arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-05 至 2026-02-05 共收录 41 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 41 篇

2602.04406 2026-02-05 cs.CV 83%

LCUDiff: Latent Capacity Upgrade Diffusion for Faithful Human Body Restoration

LCUDiff: 基于潜在空间升级的扩散模型用于忠实的人体图像修复

Jue Gong, Zihan Zhou, Jingkai Wang, Shu Li, Libo Liu, Jianliang Lan, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shenzhen Transsion Holdings Co., Ltd.(深圳Transsion控股有限公司)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 LCUDiff通过升级潜在空间和改进解码器路由,实现了更高质量的人体图像修复,提升了保真度和效率。

Comments 8 pages, 7 figures. The code and model will be at https://github.com/gobunu/LCUDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21380 2026-02-05 cs.LG cs.CV 83%

Sparse-to-Sparse Training of Diffusion Models

扩散模型的稀疏到稀疏训练

Inês Cardoso Oliveira, Decebal Constantin Mocanu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出稀疏到稀疏训练范式,用于提升扩散模型在训练和推理效率上的性能,通过实验表明稀疏DMs在性能上优于密集模型,同时减少计算资源消耗。

Comments Accepted to TMLR

Journal ref Transactions on Machine Learning Research (TMLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04814 2026-02-05 cs.CV cs.GR 81%

X2HDR: HDR Image Generation in a Perceptually Uniform Space

X2HDR:在感知均匀空间中实现HDR图像生成

Ronghuan Wu, Wanchao Su, Kede Ma, Jing Liao, Rafał K. Mantiuk

机构 * City University of Hong Kong(香港城市大学) Monash University(墨尔本大学) University of Cambridge(剑桥大学)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV、cs.GR

AI总结 X2HDR通过感知均匀编码实现HDR图像生成,利用预训练模型适应HDR生成,提升图像保真度和动态范围。

Comments Project page: https://x2hdr.github.io/, Code: https://github.com/X2HDR/X2HDR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04873 2026-02-05 cs.CV 79%

Laminating Representation Autoencoders for Efficient Diffusion

对扩散模型进行表示编码器的封装以提高效率

Ramón Calvo-González, François Fleuret

机构 * University of Geneva(日内瓦大学) FAIR, Meta(FAIR与Meta)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FlatDINO通过将DINOv2的补丁特征压缩为一维序列,显著降低了扩散模型的计算成本,实现了更高的效率和更优的图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03122 2026-02-05 cs.CV cs.AI 79%

HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion

HAVIR: 基于CLIP引导的多功能扩散模型的分层视觉到图像重建

Shiyi Zhang, Dong Liang, Hairong Zheng, Yihang Zhou

机构 * Research Center for Medical AI, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(医学人工智能研究中心,深圳先进技术研究所,中国科学院) Research Center for Biomedical Imaging, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(生物医学成像研究中心,深圳先进技术研究所,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HAVIR通过分层结构生成和语义提取,结合CLIP引导的多功能扩散模型,提升复杂场景下的图像重建质量。

Journal ref 2025 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19742 2026-02-05 cs.CV 79%

HAODiff: Human-Aware One-Step Diffusion via Dual-Prompt Guidance

HAODiff: 人类感知的单步扩散 via 双提示引导

Jue Gong, Tingyu Yang, Jingkai Wang, Zheng Chen, Xing Liu, Hong Gu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HAODiff通过双提示引导方法,针对人类运动模糊和通用噪声问题,提升图像修复的鲁棒性和视觉质量。

Comments 9 pages, 8 figures. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04300 2026-02-05 cs.CV 79%

Light Up Your Face: A Physically Consistent Dataset and Diffusion Model for Face Fill-Light Enhancement

点亮你的脸:一个物理一致的数据集和扩散模型用于人脸填充光增强

Jue Gong, Zihan Zhou, Jingkai Wang, Xiaohong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出LightYourFace-160K数据集和FiLitDiff模型,通过物理一致的渲染器和扩散模型实现高质量的人脸填充光增强,提升光照处理的可控性和保真度。

Comments 8 pages, 7 figures. The code and model will be available at https://github.com/gobunu/Light-Up-Your-Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04220 2026-02-05 cs.CV 79%

Adaptive 1D Video Diffusion Autoencoder

自适应一维视频扩散自编码器

Yao Teng, Minxuan Lin, Xian Liu, Shuai Wang, Xiao Yang, Xihui Liu

机构 * The University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司) CUHK(香港中文大学) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种自适应一维视频扩散自编码器,通过改进的编码和解码机制实现更高效的视频压缩与重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21610 2026-02-05 cs.CV 79%

WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models

WMVLM:通过视觉-语言模型评估扩散模型图像水印

Zijin Yang, Yu Sun, Kejiang Chen, Jiawei Zhao, Jun Jiang, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WMVLM通过视觉-语言模型提出首个统一且可解释的扩散模型图像水印评估框架,重新定义了残差和语义水印的评估指标,并通过三阶段训练策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17957 2026-02-05 cs.CV 79%

DiffVax: Optimization-Free Image Immunization Against Diffusion-Based Editing

DiffVax: 面向扩散编辑的无优化图像免疫方法

Tarik Can Ozden, Ozgur Kara, Oguzhan Akcin, Kerem Zaman, Shashank Srivastava, Sandeep P. Chinchali, James M. Rehg

机构 * UIUC(伊利诺伊大学香槟分校) UT Austin(得克萨斯大学奥斯汀分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffVax通过无优化的损失项实现高效的图像免疫,显著提升防御扩散编辑的速度和鲁棒性。

Comments Accepted into ICLR 2026. Project webpage: https://diffvax.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06148 2026-02-05 cs.LG stat.ML 79%

From discrete-time policies to continuous-time diffusion samplers: Asymptotic equivalences and faster training

从离散时间策略到连续时间扩散采样器:渐近等价与更快的训练

Julius Berner, Lorenz Richter, Marcin Sendera, Jarrid Rector-Brooks, Nikolay Malkin

机构 * California Institute of Technology(加州理工学院) NVIDIA(英伟达) Zuse Institute Berlin(柏林泽尼克研究所) dida Datenschmiede GmbH(dida数据隐私公司) Jagiellonian University(雅盖隆大学) Mila, Université de Montréal(蒙特利尔大学机器学习研究所) University of Edinburgh(爱丁堡大学) CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器学习与大脑学习)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过渐近等价性将离散时间策略转化为连续时间扩散采样器,提升训练效率和采样性能。

Comments TMLR final version; code: https://github.com/GFNOrg/gfn-diffusion/tree/stagger

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04730 2026-02-05 nlin.CD physics.flu-dyn 78%

Semiclassical Structure of the Advection--Diffusion Spectrum in Mixed Phase Spaces

准经典结构:混合相空间中对流-扩散谱的结构

Christopher Amey, Bala Sundaram, Andrew C. Poje

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究混合相空间中对流-扩散谱的准经典结构,揭示不同模态类的共存与竞争,指出谱隙不存在统一控制,慢模式为扩散,高阶模式间存在微小间隙。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04404 2026-02-05 cs.LG cond-mat.dis-nn 78%

Theory of Speciation Transitions in Diffusion Models with General Class Structure

扩散模型中具有通用类结构的物种过渡理论

Beatrice Achilli, Marco Benedetti, Giulio Biroli, Marc Mézard

机构 * 1 Department of Computing Sciences, Bocconi University, Milan, Italy 2 Laboratoire de Physique de l’\'Ecole Normale Sup\'erieure, ENS, Universit\'e PSL, CNRS, Sorbonne Universit\'e, Universit\'e de Paris, F-75005 Paris, France.

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种适用于任意目标分布的扩散模型物种过渡理论,通过自由能差表征物种时间,并通过分析异或模型和高斯混合模型验证了理论的普适性。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04399 2026-02-05 cs.CL 78%

Swordsman: Entropy-Driven Adaptive Block Partition for Efficient Diffusion Language Models

Swordsman: 基于熵驱动的自适应块划分用于高效的扩散语言模型

Yu Zhang, Xinchen Li, Jialei Zhou, Hongnan Ma, Zhongwei Wan, Yiwei Shi, Duoqian Miao, Qi Zhang, Longbing Cao

机构 * Tongji University(同济大学) The Ohio State University(俄亥俄州立大学) University of Bristol(布里斯托大学) Macquarie University(麦考瑞大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 Swordsman通过熵驱动的自适应块划分提升扩散语言模型的推理效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03312 2026-02-05 q-bio.BM cs.LG 78%

Unlocking hidden biomolecular conformational landscapes in diffusion models at inference time

在推理时间解锁扩散模型中隐藏的生物分子构象景观

Daniel D. Richman, Jessica Karaguesian, Carl-Mikael Suomivuori, Ron O. Dror

机构 * Stanford University(斯坦福大学) Yale School of Medicine(耶鲁医学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ConforMix通过结合分类引导、过滤和自由能估计,提升扩散模型在推理时对生物分子构象变化的采样能力,实现更高效的构象发现。

Comments Project page: https://github.com/drorlab/conformix

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08458 2026-02-05 cs.LG 78%

Discrete Diffusion-Based Model-Level Explanation of Heterogeneous GNNs with Node Features

基于离散扩散的异构图神经网络节点特征模型级解释

Pallabee Das, Stefan Heindorf

机构 * Paderborn University(帕德博恩大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiGNNExplainer通过离散去噪扩散生成异构图的真实节点特征,提供更真实可信的模型级解释,优于现有方法。

Comments Accepted at WWW 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04082 2026-02-05 cs.LG cs.NA math.NA 78%

A Probabilistic Framework for Solving High-Frequency Helmholtz Equations via Diffusion Models

基于扩散模型的高频率亥姆霍兹方程求解概率框架

Yicheng Zou, Samuel Lanthaler, Hossein Salahshoor

机构 * Department of Civil and Environmental Engineering(土木与环境工程系) Department of Mechanical Engineering and Materials Science(机械工程与材料科学系) Department of Mathematics(数学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的概率框架,用于高频率亥姆霍兹方程的求解,通过稳定性分析和实验验证,展示了其在L2、H1和能量范数中的高精度预测能力及对输入不确定性的有效捕捉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03112 2026-02-05 cs.RO 78%

A Unified Candidate Set with Scene-Adaptive Refinement via Diffusion for End-to-End Autonomous Driving

通过扩散生成场景自适应候选集的统一候选集用于端到端自动驾驶

Zhengfei Wu, Shuaixi Pan, Shuohan Chen, Shuo Yang, Yanjun Huang

机构 * School of Automotive Studies, Tongji University, Shanghai, China(同济大学汽车学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 CdDrive通过扩散生成场景自适应候选集,提升端到端自动驾驶的候选集设计与轨迹平滑性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01656 2026-02-05 math.NA cs.NA math.OC 78%

Numerical methods for diffusion coefficient recovery

扩散系数恢复的数值方法

Sahat Pandapotan Nainggolan, Julius Fergy Tiongson Rabago, Hirofumi Notsu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种改进的CCBM方法,通过正则化优化和梯度加权技术,实现对空间变化扩散系数的稳定恢复。

Comments 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00157 2026-02-05 q-bio.QM cs.AI q-bio.BM 78%

ProDCARL: Reinforcement Learning-Aligned Diffusion Models for De Novo Antimicrobial Peptide Design

ProDCARL:用于从头设计抗菌肽的强化学习对齐扩散模型

Fang Sheng, Mohammad Noaeen, Zahra Shakeri

机构 * University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ProDCARL通过强化学习对齐框架,结合扩散模型和序列属性预测器,优化抗菌肽设计,提高预测性能和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21006 2026-02-05 physics.plasm-ph 78%

A joint diffusion approach to multi-modal inference in inertial confinement fusion

一种联合扩散方法用于惯性约束聚变中的多模态推断

Michael S. Jones, Justin Kunimune, Daniel Casey, Bogdan Kustowski, Eugene Kur, Kelli Humbird

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出JointDiff方法,通过联合扩散统一正向建模、逆向推断和输出填补,提升惯性约束聚变实验的多模态推断精度与可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06514 2026-02-05 stat.ML cs.LG cs.NA math.NA math.OC math.ST stat.TH 78%

Inference-Time Alignment for Diffusion Models via Variationally Stable Doob's Matching

通过变分稳定的Doob匹配实现扩散模型的推理时间对齐

Jinyuan Chang, Chenguang Duan, Yuling Jiao, Yi Xu, Jerry Zhijian Yang

机构 * Joint Laboratory of Data Science and Business Intelligence(数据科学与商业智能联合实验室) State Key Laboratory of Mathematical Sciences(数学科学国家重点实验室) Institut für Geometrie und Praktische Mathematik(几何与应用数学研究所) School of Artificial Intelligence(人工智能学院) School of Mathematics and Statistics(数学与统计学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出变分稳定的Doob匹配框架,通过可证明的引导估计方法,实现扩散模型在推理时间的分布对齐,同时保证生成分布的收敛性与低维适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02235 2026-02-05 stat.ME econ.EM 78%

Diffusion Index Forecasting with Tensor Data

基于张量数据的扩散指数预测

Bin Chen, Yuefeng Han, Qiyang Yu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于张量数据的扩散指数预测方法,结合张量因子模型和稀疏回归模型,有效处理高维数据和横截面依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14158 2026-02-05 physics.ao-ph cs.LG 78%

Machine learning emulation of precipitation from km-scale UK regional climate simulations using a diffusion model

利用扩散模型对英国区域气候模拟中的降水进行机器学习模拟

Henry Addison, Elizabeth Kendon, Suman Ravuri, Laurence Aitchison, Peter AG Watson

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用扩散模型对英国区域气候模拟中的降水进行高效模拟,以降低计算成本并提升预测精度。

Comments 60 pages, 13 figures, 4 tables; Supplementary Information: 9 pages, 8 figures, 1 table; accepted for publication in JAMES

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21896 2026-02-05 cs.CV 74%

Past- and Future-Informed KV Cache Policy with Salience Estimation in Autoregressive Video Diffusion

具有显著性估计的过去和未来信息KV缓存策略在自回归视频扩散中

Hanmo Chen, Chenghao Xu, Xu Yang, Xuan Chen, Cheng Deng

机构 * Hangzhou Institute of Technology, Xidian University, Hangzhou, China(杭州理工大学,西安电子科技大学,中国杭州) Xidian University, Xi'an, China(西安电子科技大学,中国西安) Hohai University, Nanjing, China(河海大学,中国南京)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 本文提出PaFu-KV策略,通过显著性估计优化KV缓存,提升视频生成的质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04374 2026-02-05 astro-ph.GA physics.chem-ph 71%

Atom Addition Formation of Thionylimide (HNSO) on Interstellar Dust Grains: Chemical routes requiring oxygen and nitrogen atom surface diffusion

硫代亚胺(HNSO)在星际尘埃颗粒上的原子添加形成:需要氧和氮原子表面扩散的化学路径

Juan Carlos del Valle, Miguel Sanz-Novo, Johannes Kästner, Kenji Furuya, Víctor M. Rivilla, Rafael Martín-Domńech, Germán Molpeceres

专题命中 扩散模型 :diffusion(title)

AI总结 研究通过量子化学计算揭示HNSO在星际尘埃颗粒上的形成机制,表明氧和氮原子表面扩散在硫化学中起关键作用。

Comments Accepted in ACSESC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01786 2026-02-05 cond-mat.soft 71%

Rheologically tuned diffusion modulates quorum sensing in Vibrio fischeri

流变学调制的扩散调控维多利亚菌的群体感应

Chunhe Li, Zixiang Lin, Hongyi Bian, Anqi Li, Honyi Xin, Zijie Qu

专题命中 扩散模型 :diffusion(title)

AI总结 研究发现流体粘度和流变学性质影响维多利亚菌运动和生物发光,揭示物理环境与细菌集体行为的直接联系。

Comments main: 10 pages, 4 figures; SI: 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04565 2026-02-05 cs.CV 57%

Understanding Degradation with Vision Language Model

理解视觉退化

Guanzhou Lan, Chenyi Liao, Yuqi Yang, Qianli Ma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学与电子学(iOPEN)、西北工业大学) Honors College, Northwestern Polytechnical University(荣誉学院、西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiaotong University(人工智能学院、上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出DU-VLM模型,通过结构化奖励强化学习解决视觉退化理解问题,引入大规模数据集并实现高保真图像恢复。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04292 2026-02-05 cs.GR 57%

Event-T2M: Event-level Conditioning for Complex Text-to-Motion Synthesis

事件级条件化:复杂文本到动作合成的事件级条件化

Seong-Eun Hong, JaeYoung Seon, JuYeong Hwang, JongHwan Shin, HyeongYeop Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 Event-T2M通过事件级条件化方法提升复杂文本到动作合成的生成质量,验证了事件定义的有效性与多事件动作生成的优越性。

Comments 28 pages, 7 figures. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03973 2026-02-05 cs.RO cs.CV 57%

VLS: Steering Pretrained Robot Policies via Vision-Language Models

VLS:通过视觉-语言模型引导预训练的机器人策略

Shuo Liu, Ishneet Sukhvinder Singh, Yiqing Xu, Jiafei Duan, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 VLS通过视觉-语言模型在推理时引导预训练机器人策略,实现无需训练的适应,提升在不同环境下的表现。

Comments 11 Pages, Project page: https://vision-language-steering.github.io/webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏