arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-06 至 2026-02-06 共收录 73 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 47 篇

2602.05257 2026-02-06 cs.CV cs.RO 57%

RFM-Pose:Reinforcement-Guided Flow Matching for Fast Category-Level 6D Pose Estimation

RFM-Pose:强化引导的流匹配用于快速的类别级6D位姿估计

Diya He, Qingchen Liu, Cong Zhang, Jiahu Qin

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RFM-Pose通过强化学习框架提升类别级6D位姿估计效率,结合流匹配生成模型与近端策略优化实现快速且高效的位姿生成与假设评估。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05163 2026-02-06 cs.CV 57%

LOBSTgER-enhance: an underwater image enhancement pipeline

LOBSTgER-enhance: 一种水下图像增强流水线

Andreas Mentzelopoulos, Keith Ellenbogen

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 LOBSTgER-enhance通过合成破坏流水线和扩散生成技术,实现了水下图像的高质量增强,提升了图像的视觉一致性和泛化能力。

Comments 12 pages, 30 figures, work done as part of LOBSTgER

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15281 2026-02-06 cs.CV 57%

StyleMe3D: Stylization with Disentangled Priors by Multiple Encoders on 3D Gaussians

StyleMe3D: 通过多编码器在3D高斯上实现解耦先验的风格化

Cailin Zhuang, Yaoqi Hu, Xuanyang Zhang, Wei Cheng, Jiacheng Bao, Shengqi Liu, Yiying Yang, Xianfang Zeng, Gang Yu, Ming Li

机构 * ShanghaiTech University(上海科技大学) StepFun AIGC Research(AIGC研究院) Guangming Laboratory(光明实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 StyleMe3D通过多编码器在3D高斯上实现解耦先验的风格化,利用动态风格分数蒸馏和多模态对齐策略提升风格迁移效果。

Comments 18 pages; Project page: https://styleme3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05931 2026-02-06 cs.ET 50%

Task-Adaptive Physical Reservoir Computing via Tunable Molecular Communication Dynamics

任务自适应的可调分子通信动态物理共振计算

Saad Yousuf, Kaan Burak Ikiz, Murat Kuscu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于可调分子通信动态的物理共振计算方法,通过双模拟方法和贝叶斯优化,实现对不同计算任务的自适应优化,展示了在混沌时间序列预测和非线性数据转换中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05815 2026-02-06 cond-mat.str-el cond-mat.stat-mech 50%

Suppressed coarsening after an interaction quench in the Holstein chain

相互作用淬火后Holstein链中的抑制粗化

Ho Jang, Gia-Wei Chern

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了Holstein链中相互作用淬火后抑制粗化的机制,通过非绝热框架分析电子-声子耦合影响下的非平衡动力学,发现kink密度的非传统代数衰减。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05812 2026-02-06 cs.LG stat.ML 50%

Principled Confidence Estimation for Deep Computed Tomography

深度计算层析成像的原理性置信度估计

Matteo Gätzner, Johannes Kirschner

机构 * ETH Zürich(苏黎世联邦理工学院) Swiss Data Science Center(瑞士数据科学中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种原理性的置信度估计框架,用于深度学习CT重建,通过理论覆盖保证和更紧的置信区域,提高医学影像的不确定性感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05584 2026-02-06 eess.SY cs.SY 50%

Fairness-aware design of nudging policies under stochasticity and prejudices

在不确定性和偏见下具有公平性的引导政策设计

Lisa Piccinin, Camilla Quaresmini, Edoardo Vitale, Mara Tanelli, Valentina Breschi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种考虑公平性的引导政策设计,通过平等和公平目标减少社会不平等,提升创新扩散效果。

Comments Submitted to IFAC WC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05443 2026-02-06 eess.AS cs.SD 50%

Wave-Trainer-Fit: Neural Vocoder with Trainable Prior and Fixed-Point Iteration towards High-Quality Speech Generation from SSL features

Wave-Trainer-Fit: 基于可训练先验和固定点迭代的神经语音合成器

Hien Ohnaka, Yuma Shirahata, Masaya Kawamura

机构 * Nara Institute of Science and Technology(奈良科学技术大学) LY Corporation(LY公司)

专题命中 扩散模型 :diffusion(abstract)

AI总结 WaveTrainerFit通过引入可训练先验和固定点迭代,提升从SSL特征生成高质量语音的效果,减少推理步骤并提高语音相似度。

Comments Accepted by IEEE ICASSP 2026. 5 pages, 3 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05328 2026-02-06 math.AP 50%

Precise propagation profile for some monostable free boundary problems in time-periodic media

某些时间周期性介质中单稳自由边界问题的精确传播特性

Yihong Du, Zhuo Ma, Zhi-Cheng Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了时间周期性介质中单稳自由边界问题的精确传播特性,证明了半波解的存在性和唯一性,并获得了解向半波解收敛的精确描述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01789 2026-02-06 cs.RO 50%

RFS: Reinforcement Learning with Residual Flow Steering for Dexterous Manipulation

RFS: 通过残差流引导的强化学习用于灵巧操作

Entong Su, Tyler Westenbroek, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington, Paul G. Allen School of Computer Science & Engineering(华盛顿大学,保罗·G·艾伦计算机科学与工程学院) Amazon Frontier AI & Robotics(亚马逊前沿人工智能与机器人)

专题命中 扩散模型 :diffusion(abstract)

AI总结 RFS通过残差流引导强化学习,实现高效适应预训练生成策略,提升灵巧操作任务的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11963 2026-02-06 eess.IV 50%

Noisy MRI Reconstruction via MAP Estimation with an Implicit Deep-Denoiser Prior

通过隐式深度去噪先验进行噪声MRI重建

Nikola Janjušević, Amirhossein Khalilian-Gourtani, Yao Wang, Li Feng

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出ImMAP框架,通过整合噪声模型到MAP中,提升MRI在现实噪声下的重建可靠性与可解释性。

Comments 6 pages, 5 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00771 2026-02-06 eess.AS cs.AI cs.SD eess.SP 50%

UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching

UniverSR: 一种无需编解码器的统一且多功能的音频超分辨率方法

Woongjib Choi, Sangmin Lee, Hyungseob Lim, Hong-Goo Kang

机构 * Dept. of Electrical \& Electronic Engineering, Yonsei University, Seoul, South Korea

专题命中 扩散模型 :diffusion(abstract)

AI总结 UniverSR提出了一种无需编解码器的音频超分辨率方法,通过流匹配生成模型直接重建波形,提升音频质量和效率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23939 2026-02-06 cond-mat.stat-mech 50%

Heat dissipation in marginally stable linear time-delayed Langevin systems

边缘稳定线性时滞 Langevin 系统中的散热

Xin Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了边缘稳定线性时滞 Langevin 系统的散热行为,发现扩散临界性和振荡临界性在热力学特征上有根本差异,揭示了非稳态时滞动力学的散热机制。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08202 2026-02-06 math.PR 50%

Stochastic dissipative systems in Banach spaces driven by Lévy noise

Banach空间中由莱维噪声驱动的随机耗散系统

Davide A. Bignamini, Enrico Priola

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了Banach空间中由莱维噪声驱动的随机耗散系统方程的适定性,探讨了在连续函数空间上的新结果,并统一了不同框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05067 2026-02-06 cond-mat.mes-hall 50%

Strong radial electric field scaling near nanoscale conductive filaments and the ReRAM resistive switching mechanism

纳米尺度导电丝附近强径向电场标度与ReRAM电阻开关机制

Robin Jacobs-Gedrim, William Wahby, Thomas Awe, Patrick Xiao, Melvin Witten, Jacob Martinez-Marez, Kiran Seetala, David Hughart, Alec Talin, Christopher Bennett, Matthew Marinella, Gennadi Bersuker, Sapan Agarwal

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文揭示了纳米尺度导电路径中表面电荷诱导的强径向电场,解释了ReRAM中负电阻开关机制的物理原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05051 2026-02-06 cs.LG cs.AI cs.RO 50%

ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation

ReFORM:通过噪声操控实现支持下的离线强化学习

Songyuan Zhang, Oswin So, H. M. Sabbir Ahmad, Eric Yang Yu, Matthew Cleaveland, Mitchell Black, Chuchu Fan

机构 * MIT(麻省理工学院) Boston University(波士顿大学) MIT Lincoln Laboratory(麻省理工学院林伍德实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 ReFORM通过反射流策略和噪声操控,在离线强化学习中实现更宽松的支持约束,从而在多模态分布下提升策略性能。

Comments 24 pages, 17 figures; Accepted by the fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04906 2026-02-06 cs.LG 50%

LISA: Laplacian In-context Spectral Analysis

LISA:拉普拉斯内省谱分析

Julio Candanedo

专题命中 扩散模型 :diffusion(abstract)

AI总结 LISA通过结合延迟坐标嵌入和拉普拉斯谱学习,在推理时间适应时间序列模型,提升预测性能,尤其在动态变化环境下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02276 2026-02-06 cs.LG cs.AI cs.CL q-bio.QM 50%

CellForge: Agentic Design of Virtual Cell Models

CellForge: 虚拟细胞模型的代理设计

Xiangru Tang, Zhuoyun Yu, Jiapeng Chen, Yan Cui, Daniel Shao, Weixu Wang, Fang Wu, Yuchen Zhuang, Wenqi Shi, Zhi Huang, Arman Cohan, Xihong Lin, Fabian Theis, Smita Krishnaswamy, Mark Gerstein

专题命中 扩散模型 :diffusion(abstract)

AI总结 CellForge通过多代理协作自主设计虚拟细胞模型,生成高竞争力的计算方法,推动计算生物学的自主科学方法开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07270 2026-02-06 nlin.PS math.AP 50%

Instability of anchored spirals in geometric flows

几何流中锚定螺旋的不稳定性

Anthony Cortez, Nan Li, Nathan Mihm, Alice Xu, Xiaoxing Yu, Arnd Scheel

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了几何流中锚定螺旋波的存在性、稳定性和不稳定性,揭示了波列对横模调制不稳定性对反应扩散系统中螺旋波不稳定性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 11 篇

2506.01758 2026-02-06 cs.CV 79%

Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks

许多对许多:统一多个视频和图像生成与操控任务的训练

Ruibin Li, Tao Yang, Yangming Shi, Weiguo Feng, Shilei Wen, Bingyue Peng, Lei Zhang

机构 * ByteDance(字节跳动) The Hong Kong Polytechnic University(香港理工大学)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出many-for-many框架,通过统一训练多个视频和图像生成与操控任务,提升视频生成性能并引入深度图条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15259 2026-02-06 cs.CV cs.AI 79%

Bringing Diversity from Diffusion Models to Semantic-Guided Face Asset Generation

从扩散模型中引入多样性以实现语义引导的面部资产生成

Yunxuan Cai, Sitao Xiang, Zongjian Li, Haiwei Chen, Yajie Zhao

机构 * University of Southern California, USC Institute for Creative Technologies(美国南加州大学,USC创意技术研究所) USC Institute for Creative Technologies(USC创意技术研究所)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种语义可控的生成网络,通过扩散模型生成高质量3D面部数据库,并开发了高效的GAN基生成器,用于创建和编辑高质量面部资产。

Comments Accepted Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05013 2026-02-06 cs.GR cs.CV 62%

Untwisting RoPE: Frequency Control for Shared Attention in DiTs

解开RoPE:多模态和共享注意力中的频率控制

Aryan Mikaeili, Or Patashnik, Andrea Tagliasacchi, Daniel Cohen-Or, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) University of Toronto(多伦多大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文通过分析RoPE的频率结构,提出方法调节RoPE频率带以实现更符合语义的共享注意力,从而有效控制风格迁移与内容复制的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06042 2026-02-06 cs.LG cs.CV 57%

Pseudo-Invertible Neural Networks

伪可逆神经网络

Yamit Ehrlich, Nimrod Berman, Assaf Shocher

机构 * Ben-Gurion University(本·古里安大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出伪可逆神经网络,用于解决非线性逆问题,通过非线性反向投影实现零样本逆向生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05966 2026-02-06 cs.CV cs.AI 57%

LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation

LSA:局部语义对齐用于增强交通视频生成中的时间一致性

Mirlan Karimov, Teodora Spasojevic, Markus Braun, Julian Wiederer, Vasileios Belagiannis, Marc Pollefeys

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ETH Zurich(苏黎世联邦理工学院) Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LSA通过局部语义对齐提升交通视频生成的时间一致性,无需外部控制信号。

Comments Accepted to IEEE IV 2026. 8 pages, 3 figures. Code available at https://github.com/mirlanium/LSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05534 2026-02-06 cs.CV 57%

SSG: Scaled Spatial Guidance for Multi-Scale Visual Autoregressive Generation

SSG: 多尺度视觉自回归生成的缩放空间引导

Youngwoo Shin, Jiwan Hur, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SSG通过缩放空间引导方法,在无需训练的情况下提升多尺度视觉自回归生成的保真度和多样性,同时保持低延迟。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05213 2026-02-06 cs.CV 57%

Dual-Representation Image Compression at Ultra-Low Bitrates via Explicit Semantics and Implicit Textures

通过显式语义和隐式纹理实现超低比特率的双表示图像压缩

Chuqin Zhou, Xiaoyue Ling, Yunuo Chen, Jincheng Dai, Guo Lu, Wenjun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种融合显式语义和隐式纹理的图像压缩框架,通过无训练的方式提升超低比特率下的压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05331 2026-02-06 math.AP 50%

Dynamics of a nonlocal epidemic model with a new free boundary condition, part 1: Spreading-vanishing dichotomy

非局部流行病模型的动力学研究:带有新自由边界条件的扩散-反应系统,第一部分:扩散-消失二元性

Yao Chen, Yihong Du, Wan-Tong Li, Rong Wang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种新的自由边界条件,研究非局部流行病模型的长期动力学行为,揭示了扩散与消失的二元性及其精确阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21200 2026-02-06 stat.ML cs.LG 50%

Provably Reliable Classifier Guidance via Cross-Entropy Control

通过交叉熵控制实现可证明可靠的分类器引导

Sharan Sahu, Arisina Banerjee, Yuchen Wu

专题命中 可控生成 :diffusion(abstract)

AI总结 本文通过交叉熵控制证明了分类器引导扩散模型的可靠性,建立了分类器训练与引导对齐的理论联系。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11523 2026-02-06 math.OC 50%

An infinite horizon sufficient stochastic maximum principle for regime switching diffusions and applications

无限时间充分随机最大原理及其在 regime switching 扩散中的应用

Kai Ding, Xun Li, Siyu Lv, Xin Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种无限时间 horizon 的随机最大原理,用于 regime switching 扩散的最优控制问题,并通过线性二次生产计划问题展示了其应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05207 2026-02-06 eess.AS cs.AI 50%

ARCHI-TTS: A flow-matching-based Text-to-Speech Model with Self-supervised Semantic Aligner and Accelerated Inference

ARCHI-TTS: 一种基于流匹配的文本到语音模型,配备自监督语义对齐器和加速推理

Chunyat Wu, Jiajun Deng, Zhengxi Liu, Zheqi Dai, Haolin He, Qiuqiang Kong

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 ARCHI-TTS通过自监督语义对齐器和高效推理策略,实现了高效率的文本到语音合成,优于现有最先进系统。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏