arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2509.08422 2026-02-11 cs.CV cs.LG 79%

LD-ViCE: Latent Diffusion Model for Video Counterfactual Explanations

LD-ViCE:基于视频的反事实解释的潜在扩散模型

Payal Varshney, Adriano Lucieri, Christoph Balada, Sheraz Ahmed, Andreas Dengel

机构 * Rheinland-Pfälzische Technische Universität Kaiserslautern-Landau(莱茵-瓦尔德大学凯泽斯劳滕-兰道分校) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LD-ViCE通过潜在扩散模型生成高质量的视频反事实解释,提升模型可解释性和可信度。

Comments 44 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16081 2026-02-11 cs.CV cs.CL 79%

Survey of Video Diffusion Models: Foundations, Implementations, and Applications

视频扩散模型综述:基础、实现与应用

Yimu Wang, Xuye Liu, Wei Pang, Li Ma, Shuai Yuan, Paul Debevec, Ning Yu

机构 * University of Waterloo(滑铁卢大学) Netflix Eyeline Studios Duke University(杜克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文综述视频扩散模型的基础、实现与应用,系统梳理了当前方法学体系,分析架构创新与优化策略,并探讨其在视频生成中的实际应用及与其他领域的协同作用。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20240 2026-02-11 cs.CV 79%

Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion Models

无条件先验很重要!改进细调扩散模型的条件生成

Prin Phunyaphibarn, Phillip Y. Lee, Jaihoon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过替换无条件噪声提升条件生成质量,验证了使用其他扩散模型进行无条件噪声预测的有效性。

Comments WACV 2026; Project Page: https://unconditional-priors-matter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16598 2026-02-11 cs.CR cs.CV cs.LG 79%

DiffBreak: Is Diffusion-Based Purification Robust?

DiffBreak: 差分法净化是否具有鲁棒性?

Andre Kassis, Urs Hengartner, Yaoliang Yu

机构 * Cheriton School of Computer Science, University of Waterloo(查尔顿计算机科学学院,滑铁卢大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffBreak研究指出基于差分的净化存在鲁棒性缺陷,提出改进方法并挑战其有效性。

Journal ref Advances in Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12188 2026-02-11 cs.CV cs.LG 79%

Constant Rate Scheduling: A General Framework for Optimizing Diffusion Noise Schedule via Distributional Change

恒定速率调度:通过分布变化优化扩散噪声调度的通用框架

Shuntaro Okada, Kenji Doi, Ryota Yoshihashi, Hirokatsu Kataoka, Tomohiro Tanaka

机构 * LY Corporation, Japan(日本LY公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种通过分布变化优化扩散噪声调度的通用框架,通过恒定速率变化提升扩散模型在像素空间和潜在空间中的性能,实现更高质量的样本生成。

Comments Published in Transactions on Machine Learning Research (TMLR), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04162 2026-02-10 cs.CV cs.AI eess.IV 79%

Improving 2D Diffusion Models for 3D Medical Imaging with Inter-Slice Consistent Stochasticity

通过跨切片一致的随机性改进2D扩散模型用于3D医学影像

Chenhe Du, Qing Wu, Xuanyu Tian, Jingyi Yu, Hongjiang Wei, Yuyao Zhang

机构 * ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过引入跨切片一致的随机性策略,改进2D扩散模型以提升3D医学影像重建的保真度与一致性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08059 2026-02-10 cs.CV cs.AI 79%

DICE: Disentangling Artist Style from Content via Contrastive Subspace Decomposition in Diffusion Models

DICE: 通过对比子空间分解在扩散模型中解构艺术家风格与内容

Tong Zhang, Ru Zhang, Jianyi Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DICE通过对比子空间分解在扩散模型中解构艺术家风格与内容,实现无需训练的实时风格消除,提升部署端安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07980 2026-02-10 cs.CV 79%

Continuity-driven Synergistic Diffusion with Neural Priors for Ultra-Sparse-View CBCT Reconstruction

基于神经先验的连续驱动协同扩散用于超稀疏视角CBCT重建

Junlin Wang, Jiancheng Fang, Peng Peng, Shaoyu Wang, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CSDN方法,利用神经先验和协同扩散策略,有效提升超稀疏视角CBCT重建的图像质量和连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07979 2026-02-10 cs.CV 79%

FSP-Diff: Full-Spectrum Prior-Enhanced DualDomain Latent Diffusion for Ultra-Low-Dose Spectral CT Reconstruction

FSP-Diff: 全谱先验增强双域潜在扩散用于超低剂量能谱CT重建

Peng Peng, Xinrui Zhang, Junlin Wang, Lei Li, Shaoyu Wang, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FSP-Diff通过全谱先验增强双域潜在扩散框架,提升超低剂量能谱CT重建的图像质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07967 2026-02-10 cs.CV 79%

EasyTune: Efficient Step-Aware Fine-Tuning for Diffusion-Based Motion Generation

EasyTune: 为基于扩散的运动生成实现高效的步感知微调

Xiaofeng Tan, Wanjiang Weng, Haodong Lei, Hongsong Wang

机构 * Southeast University(东南大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EasyTune通过在去噪每一步进行微调,解决扩散模型在运动生成中的优化效率和内存消耗问题,并引入自我完善偏好学习机制提升训练效率。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03881 2026-02-10 cs.CV cs.AI cs.LG 79%

DiGAN: Diffusion-Guided Attention Network for Early Alzheimer's Disease Detection

DiGAN:基于扩散引导的注意力网络用于早期阿尔茨海默病检测

Maxx Richard Rahman, Mostafa Hammouda, Wolfgang Maass

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiGAN通过结合扩散建模与注意力卷积网络,有效提升了早期阿尔茨海默病检测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17616 2026-02-10 cs.CV 79%

Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints

通过谱约束的长跳连接实现稳定高效的扩散变换器

Guanjie Chen, Xinyu Zhao, Yucheng Zhou, Xiaoye Qu, Tianlong Chen, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过引入长跳连接和谱约束,Skip-DiT实现了图像和视频生成中的稳定高效扩散变换器,显著提升了训练和推理效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14639 2026-02-10 cs.CV cs.CR cs.LG 79%

Differentially Private Adaptation of Diffusion Models via Noisy Aggregated Embeddings

基于噪声聚合嵌入的差分隐私扩散模型适应

Pura Peetathawatchai, Wei-Ning Chen, Berivan Isik, Sanmi Koyejo, Albert No

机构 * Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软公司) Google DeepMind(谷歌DeepMind) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DPAgg-TI方法,利用文本逆向技术在差分隐私约束下实现扩散模型的高效个性化,优于传统DP-SGD方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07057 2026-02-10 cs.CV 79%

RECITYGEN -- Interactive and Generative Participatory Urban Design Tool with Latent Diffusion and Segment Anything

RECITYGEN -- 交互式和生成式参与式城市设计工具与潜在扩散与分割任何物

Di Mo, Mingyang Sun, Chengxiu Yin, Runjia Tian, Yanhong Wu, Liyan Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RECITYGEN通过结合潜在扩散模型和交互式语义分割,为城市设计提供交互式生成工具,帮助公众参与城市更新项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04188 2026-02-09 cs.CV 79%

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

DiMo:用于运动生成与理解的离散扩散建模

Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

机构 * Huawei Central Media Technology Institute(华为中央媒体技术研究所) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiMo提出了一种离散扩散式框架,实现双向文本-运动理解和生成,通过迭代掩码标记细化提升运动质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10524 2026-02-09 cs.LG cs.CV 79%

Inverse problems with diffusion models: MAP estimation via mode-seeking loss

逆问题与扩散模型:通过模式寻求损失进行MAP估计

Sai Bharath Chandra Gutha, Ricardo Vinuesa, Hossein Azizpour

机构 * KTH Royal Institute of Technology, Sweden(皇家理工学院) University of Michigan, USA(密歇根大学) Science for Life Laboratory, Sweden(科学生命实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的逆问题求解方法,通过变分模式寻求损失实现高效MAP估计,提升图像恢复性能与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03520 2026-02-09 cs.CV 79%

FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation

FloodDiffusion:针对流式运动生成的定制扩散强迫

Yiyi Cai, Yuhan Wu, Kunhang Li, You Zhou, Bo Zheng, Haiyang Liu

机构 * Shanda AI Research Tokyo(上海沙达人工智能研究东京) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FloodDiffusion通过定制扩散强迫框架,在流式运动生成中达到SOTA性能,FID为0.057。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06195 2026-02-09 cs.CV 79%

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

DeDPO:用于扩散模型的去偏直接偏好优化

Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

机构 * Cornell University(康奈尔大学) Rutgers University(罗格斯大学) NYU(纽约大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DeDPO通过整合因果推理的去偏技术,提升扩散模型在低成本合成监督下的对齐性能,实现与人类标注数据相当的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05605 2026-02-06 cs.LG cs.AI cs.CV 79%

Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers

Shiva-DiT:基于残差的可微Top-k选择用于高效扩散变换器

Jiaji Zhang, Hailiang Zhao, Guoxuan Zhu, Ruichao Sun, Jiaju Wu, Xinkui Zhao, Hanlin Tang, Weiyi Lu, Kan Liu, Tao Lan, Lin Qu, Shuiguang Deng

机构 * AIOS, Alibaba Group(阿里云人工智能实验室,阿里巴巴集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Shiva-DiT通过基于残差的可微Top-k选择,在保持端到端可学习性的同时,实现了高效扩散变换器的剪枝,提升了计算效率并减少了硬件开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05492 2026-02-06 cs.GR 79%

Monte Carlo Rendering to Diffusion Curves with Differential BEM

蒙特卡罗渲染到扩散曲线的差分边界元法

Ryusuke Sugimoto, Christopher Batty, Siddhartha Chaudhuri, Iliyan Georgiev, Toshiya Hachisuka, Kevin Wampler, Michal Lukáč

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 本文提出了一种基于差分边界元法的算法,能够直接从噪声蒙特卡罗样本生成带阴影信息的扩散曲线矢量图形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05434 2026-02-06 cs.CV 79%

LD-SLRO: Latent Diffusion Structured Light for 3-D Reconstruction of Highly Reflective Objects

LD-SLRO: 基于潜在扩散的结构光用于高反射物体的3-D重建

Sanghoon Jeon, Gihyun Jung, Suhyeon Ka, Jae-Sang Hyun

机构 * Department of Mechanical Engineering, Yonsei University(机械工程系,延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LD-SLRO通过潜在扩散模型和改进的结构光技术,提升高反射物体的3-D重建精度与光栅质量。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16001 2026-02-06 cs.CV 79%

Image-to-Image Translation with Diffusion Transformers and CLIP-Based Image Conditioning

基于扩散变换器和CLIP的图像到图像翻译

Qiang Zhu, Kuan Lu, Menghao Huo, Yuxiao Li

机构 * Department of Mechanical and Aerospace Engineering(机械与航空航天工程系) University of Houston(休斯顿大学) School of Engineering(工程学院) Santa Clara University(圣克拉拉大学) School of Electrical and Computer Engineering(电气与计算机工程学院) Cornell University(康奈尔大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Northeastern University(东北大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散变换器和CLIP的图像到图像翻译方法,通过CLIP嵌入引导实现高质量、语义一致的图像转换,为配对图像翻译任务提供新方案。

Comments Published in: 2025 6th International Conference on Computer Vision, Image and Deep Learning (CVIDL)

Journal ref 2025 6th International Conference on Computer Vision, Image and Deep Learning (CVIDL), pp. 626-632,

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01411 2026-02-06 cs.CV 79%

Human Body Restoration with One-Step Diffusion Model and A New Benchmark

一步扩散模型与新基准的人体恢复

Jue Gong, Jingkai Wang, Zheng Chen, Xing Liu, Hong Gu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University, China(上海交通大学) vivo Mobile Communication Co., Ltd, China(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种一步扩散模型OSDHuman和新基准数据集PERSONA,用于提升人体恢复的视觉质量和定量指标。

Comments 8 pages, 9 figures. Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04873 2026-02-05 cs.CV 79%

Laminating Representation Autoencoders for Efficient Diffusion

对扩散模型进行表示编码器的封装以提高效率

Ramón Calvo-González, François Fleuret

机构 * University of Geneva(日内瓦大学) FAIR, Meta(FAIR与Meta)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FlatDINO通过将DINOv2的补丁特征压缩为一维序列,显著降低了扩散模型的计算成本,实现了更高的效率和更优的图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03122 2026-02-05 cs.CV cs.AI 79%

HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion

HAVIR: 基于CLIP引导的多功能扩散模型的分层视觉到图像重建

Shiyi Zhang, Dong Liang, Hairong Zheng, Yihang Zhou

机构 * Research Center for Medical AI, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(医学人工智能研究中心,深圳先进技术研究所,中国科学院) Research Center for Biomedical Imaging, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(生物医学成像研究中心,深圳先进技术研究所,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HAVIR通过分层结构生成和语义提取,结合CLIP引导的多功能扩散模型,提升复杂场景下的图像重建质量。

Journal ref 2025 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19742 2026-02-05 cs.CV 79%

HAODiff: Human-Aware One-Step Diffusion via Dual-Prompt Guidance

HAODiff: 人类感知的单步扩散 via 双提示引导

Jue Gong, Tingyu Yang, Jingkai Wang, Zheng Chen, Xing Liu, Hong Gu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 HAODiff通过双提示引导方法,针对人类运动模糊和通用噪声问题,提升图像修复的鲁棒性和视觉质量。

Comments 9 pages, 8 figures. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04300 2026-02-05 cs.CV 79%

Light Up Your Face: A Physically Consistent Dataset and Diffusion Model for Face Fill-Light Enhancement

点亮你的脸:一个物理一致的数据集和扩散模型用于人脸填充光增强

Jue Gong, Zihan Zhou, Jingkai Wang, Xiaohong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出LightYourFace-160K数据集和FiLitDiff模型,通过物理一致的渲染器和扩散模型实现高质量的人脸填充光增强,提升光照处理的可控性和保真度。

Comments 8 pages, 7 figures. The code and model will be available at https://github.com/gobunu/Light-Up-Your-Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04220 2026-02-05 cs.CV 79%

Adaptive 1D Video Diffusion Autoencoder

自适应一维视频扩散自编码器

Yao Teng, Minxuan Lin, Xian Liu, Shuai Wang, Xiao Yang, Xihui Liu

机构 * The University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司) CUHK(香港中文大学) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种自适应一维视频扩散自编码器,通过改进的编码和解码机制实现更高效的视频压缩与重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21610 2026-02-05 cs.CV 79%

WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models

WMVLM:通过视觉-语言模型评估扩散模型图像水印

Zijin Yang, Yu Sun, Kejiang Chen, Jiawei Zhao, Jun Jiang, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WMVLM通过视觉-语言模型提出首个统一且可解释的扩散模型图像水印评估框架,重新定义了残差和语义水印的评估指标,并通过三阶段训练策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17957 2026-02-05 cs.CV 79%

DiffVax: Optimization-Free Image Immunization Against Diffusion-Based Editing

DiffVax: 面向扩散编辑的无优化图像免疫方法

Tarik Can Ozden, Ozgur Kara, Oguzhan Akcin, Kerem Zaman, Shashank Srivastava, Sandeep P. Chinchali, James M. Rehg

机构 * UIUC(伊利诺伊大学香槟分校) UT Austin(得克萨斯大学奥斯汀分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffVax通过无优化的损失项实现高效的图像免疫,显著提升防御扩散编辑的速度和鲁棒性。

Comments Accepted into ICLR 2026. Project webpage: https://diffvax.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏