arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2602.11214 2026-02-13 cs.CV cs.RO 79%

DD-MDN: Human Trajectory Forecasting with Diffusion-Based Dual Mixture Density Networks and Uncertainty Self-Calibration

DD-MDN: 基于扩散的双混合密度网络与不确定性自校准的人体轨迹预测

Manuel Hetzel, Kerim Turacan, Hannes Reichert, Konrad Doll, Bernhard Sick

机构 * Faculty of Engineering, University of Applied Sciences Aschaffenburg(亚琛应用科学大学工程学院) Intelligent Embedded Systems Lab, University of Kassel(卡塞尔大学智能嵌入式系统实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DD-MDN通过结合扩散模型和双混合密度网络,实现高精度的人体轨迹预测,具备自校准的不确定性建模和对短观察期的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01497 2026-02-13 cs.CV 79%

Learning A Physical-aware Diffusion Model Based on Transformer for Underwater Image Enhancement

基于变压器的物理感知扩散模型学习用于水下图像增强

Chen Zhao, Chenyu Dong, Weiling Cai, Yueyue Wang

机构 * School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) School of Artificial Intelligence, Nanjing Normal University(人工智能学院,南京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于物理知识的扩散模型PA-Diff,通过物理先验生成和隐式神经重建提升水下图像增强效果,实验表明其在水下图像增强任务中表现最优。

Comments IEEE Transactions on Geoscience and Remote Sensing (TGRS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09181 2026-02-13 cs.CV 79%

Improving Efficiency of Diffusion Models via Multi-Stage Framework and Tailored Multi-Decoder Architectures

通过多阶段框架和定制多解码器架构提高扩散模型的效率

Huijie Zhang, Yifu Lu, Ismail Alkhouri, Saiprasad Ravishankar, Dogyoon Song, Qing Qu

机构 * University of Michigan(密歇根大学) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出多阶段框架和定制多解码器架构,以提高扩散模型的训练和采样效率。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10940 2026-02-12 cs.CV 79%

FastUSP: A Multi-Level Collaborative Acceleration Framework for Distributed Diffusion Model Inference

FastUSP:一种多级协作加速框架用于分布式扩散模型推理

Guandong Li

机构 * iFLYTEK

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FastUSP通过多级优化提升分布式扩散模型推理效率,重点解决内核启动开销和计算-通信调度问题,实现1.12×-1.16×的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10319 2026-02-12 cs.CV 79%

A Low-Rank Defense Method for Adversarial Attack on Diffusion Models

一种用于对抗攻击的低秩防御方法(扩散模型)

Jiaxuan Zhu, Siyu Huang

机构 * Corresponding author: Siyu Huang(通讯作者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种名为LoRD的低秩防御方法,用于防御扩散模型的对抗攻击,通过结合低秩适应模块和平衡参数,有效提升模型在对抗样本下的生成质量。

Comments Accepted by ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10221 2026-02-12 cs.CV 79%

DEGMC: Denoising Diffusion Models Based on Riemannian Equivariant Group Morphological Convolutions

DEGMC:基于黎曼等变群形态卷积的去噪扩散模型

El Hadji S. Diop, Thierno Fall, Mohamed Daoudi

机构 * NAGIP-Nonlinear Analysis and Geometric Information Processing Research Group(非线性分析与几何信息处理研究组) Department of Mathematics, University Iba Der Thiam(数学系,Iba Der Thiam大学) Institut Mines-Telecom Nord Europe, Centre for Digital Systems, CNRS Centrale Lille UMR 9189 CRIStAL, University of Lille(Institut Mines-Telecom Nord Europe数字系统中心,CNRS Centrale Lille UMR 9189 CRIStAL,Lille大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DEGMC通过引入基于黎曼等变群形态卷积的方法,改进了DDPM在几何特征提取和网络等变性方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10219 2026-02-12 cs.MM eess.IV 79%

Rethinking Security of Diffusion-based Generative Steganography

重新审视基于扩散模型的生成隐写术的安全性

Jihao Zhu, Zixuan Chen, Jiali Liu, Lingxiao Yang, Yi Zhou, Weiqi Luo, Xiaohua Xie

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 本文提出NS-DSer框架,通过分析扩散模型噪声分布与隐写安全性之间的关系,重新评估了基于扩散模型的生成隐写术的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05380 2026-02-12 cs.CV 79%

SAIL: Self-Amplified Iterative Learning for Diffusion Model Alignment with Minimal Human Feedback

SAIL:基于最小人类反馈的扩散模型对齐的自增强迭代学习

Xiaoxuan He, Siming Fu, Wanli Li, Zhiyuan Li, Dacheng Yin, Kang Rong, Fengyun Rao, Bo Zhang

机构 * ZheJiang University(浙江大学) Tencent Inc(腾讯公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SAIL通过最小人类反馈实现扩散模型对齐,利用自我增强迭代学习替代传统奖励模型和大规模标注数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17247 2026-02-12 cs.CL cs.CV 79%

From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models

从偏好到偏见:对齐调谐在视频扩散模型中塑造社会偏见的作用

Zefan Cai, Haoyi Qiu, Haozhe Zhao, Ke Wan, Jiachen Li, Jiuxiang Gu, Wen Xiao, Nanyun Peng, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) Microsoft(微软公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了对齐调谐在视频扩散模型中如何塑造社会偏见,提出VideoBiasEval框架以评估和缓解偏见,揭示了对齐调谐使偏见更稳定且刻板化的现象。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09983 2026-02-11 cs.CV cs.AI cs.LG 79%

Coupled Inference in Diffusion Models for Semantic Decomposition

扩散模型中的耦合推断用于语义分解

Calvin Yeung, Ali Zakeri, Zhuowen Zou, Mohsen Imani

机构 * Department of Computer Science University of California, Irvine(计算机科学系 加州大学伊维特分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型耦合推断的语义分解框架,通过逆问题建模和重建导向的引导项提升分解性能,并展示了其在合成任务中的优越性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09883 2026-02-11 cs.CV 79%

AdaTSQ: Pushing the Pareto Frontier of Diffusion Transformers via Temporal-Sensitivity Quantization

AdaTSQ: 通过时间敏感量化推动扩散变换器的帕累托前沿

Shaoqiu Zhang, Zizhong Ding, Kaicheng Yang, Junyi Wu, Xianglong Yan, Xi Li, Bingnan Duan, Jianping Fang, Yulun Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 AdaTSQ通过时间敏感量化方法提升扩散变换器的效率与质量,优于现有方法。

Comments Code will be released at https://github.com/Qiushao-E/AdaTSQ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09510 2026-02-11 cs.CV 79%

Robust Depth Super-Resolution via Adaptive Diffusion Sampling

通过自适应扩散采样实现鲁棒的深度超分辨率

Kun Wang, Yun Zhu, Pan Zhou, Na Zhao

机构 * Singapore University of Technology(新加坡科技设计大学) Nanjing University of Science(南京理工大学) Singapore Management University(新加坡管理大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 AdaDS通过自适应扩散采样实现鲁棒深度超分辨率,利用高斯平滑性质提升恢复鲁棒性,展现优异的零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09494 2026-02-11 cs.CV 79%

OSI: One-step Inversion Excels in Extracting Diffusion Watermarks

OSI: 一步反向在提取扩散水印中表现优异

Yuwei Chen, Zhenliang He, Jia Tang, Meina Kan, Shiguang Shan

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (CAS), China(中国科学院大学) School of Information Science and Technology, ShanghaiTech University, China(信息科学与技术学院,上海科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OSI通过一步反向高效提取高斯阴影水印,速度快20倍,精度更高,承载能力翻倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20642 2026-02-11 cs.LG cs.AI cs.CV 79%

Detecting and Mitigating Memorization in Diffusion Models through Anisotropy of the Log-Probability

通过概率的各向异性检测和缓解扩散模型中的记忆化

Rohan Asthana, Vasileios Belagiannis

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过分析概率各向异性,提出一种高效的扩散模型记忆化检测与缓解方法,提升检测效率并减少计算成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08422 2026-02-11 cs.CV cs.LG 79%

LD-ViCE: Latent Diffusion Model for Video Counterfactual Explanations

LD-ViCE:基于视频的反事实解释的潜在扩散模型

Payal Varshney, Adriano Lucieri, Christoph Balada, Sheraz Ahmed, Andreas Dengel

机构 * Rheinland-Pfälzische Technische Universität Kaiserslautern-Landau(莱茵-瓦尔德大学凯泽斯劳滕-兰道分校) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LD-ViCE通过潜在扩散模型生成高质量的视频反事实解释,提升模型可解释性和可信度。

Comments 44 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16081 2026-02-11 cs.CV cs.CL 79%

Survey of Video Diffusion Models: Foundations, Implementations, and Applications

视频扩散模型综述:基础、实现与应用

Yimu Wang, Xuye Liu, Wei Pang, Li Ma, Shuai Yuan, Paul Debevec, Ning Yu

机构 * University of Waterloo(滑铁卢大学) Netflix Eyeline Studios Duke University(杜克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文综述视频扩散模型的基础、实现与应用,系统梳理了当前方法学体系,分析架构创新与优化策略,并探讨其在视频生成中的实际应用及与其他领域的协同作用。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20240 2026-02-11 cs.CV 79%

Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion Models

无条件先验很重要!改进细调扩散模型的条件生成

Prin Phunyaphibarn, Phillip Y. Lee, Jaihoon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过替换无条件噪声提升条件生成质量,验证了使用其他扩散模型进行无条件噪声预测的有效性。

Comments WACV 2026; Project Page: https://unconditional-priors-matter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16598 2026-02-11 cs.CR cs.CV cs.LG 79%

DiffBreak: Is Diffusion-Based Purification Robust?

DiffBreak: 差分法净化是否具有鲁棒性?

Andre Kassis, Urs Hengartner, Yaoliang Yu

机构 * Cheriton School of Computer Science, University of Waterloo(查尔顿计算机科学学院,滑铁卢大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffBreak研究指出基于差分的净化存在鲁棒性缺陷,提出改进方法并挑战其有效性。

Journal ref Advances in Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12188 2026-02-11 cs.CV cs.LG 79%

Constant Rate Scheduling: A General Framework for Optimizing Diffusion Noise Schedule via Distributional Change

恒定速率调度:通过分布变化优化扩散噪声调度的通用框架

Shuntaro Okada, Kenji Doi, Ryota Yoshihashi, Hirokatsu Kataoka, Tomohiro Tanaka

机构 * LY Corporation, Japan(日本LY公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种通过分布变化优化扩散噪声调度的通用框架,通过恒定速率变化提升扩散模型在像素空间和潜在空间中的性能,实现更高质量的样本生成。

Comments Published in Transactions on Machine Learning Research (TMLR), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04162 2026-02-10 cs.CV cs.AI eess.IV 79%

Improving 2D Diffusion Models for 3D Medical Imaging with Inter-Slice Consistent Stochasticity

通过跨切片一致的随机性改进2D扩散模型用于3D医学影像

Chenhe Du, Qing Wu, Xuanyu Tian, Jingyi Yu, Hongjiang Wei, Yuyao Zhang

机构 * ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过引入跨切片一致的随机性策略,改进2D扩散模型以提升3D医学影像重建的保真度与一致性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08059 2026-02-10 cs.CV cs.AI 79%

DICE: Disentangling Artist Style from Content via Contrastive Subspace Decomposition in Diffusion Models

DICE: 通过对比子空间分解在扩散模型中解构艺术家风格与内容

Tong Zhang, Ru Zhang, Jianyi Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DICE通过对比子空间分解在扩散模型中解构艺术家风格与内容,实现无需训练的实时风格消除,提升部署端安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07980 2026-02-10 cs.CV 79%

Continuity-driven Synergistic Diffusion with Neural Priors for Ultra-Sparse-View CBCT Reconstruction

基于神经先验的连续驱动协同扩散用于超稀疏视角CBCT重建

Junlin Wang, Jiancheng Fang, Peng Peng, Shaoyu Wang, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CSDN方法,利用神经先验和协同扩散策略,有效提升超稀疏视角CBCT重建的图像质量和连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07979 2026-02-10 cs.CV 79%

FSP-Diff: Full-Spectrum Prior-Enhanced DualDomain Latent Diffusion for Ultra-Low-Dose Spectral CT Reconstruction

FSP-Diff: 全谱先验增强双域潜在扩散用于超低剂量能谱CT重建

Peng Peng, Xinrui Zhang, Junlin Wang, Lei Li, Shaoyu Wang, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FSP-Diff通过全谱先验增强双域潜在扩散框架,提升超低剂量能谱CT重建的图像质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07967 2026-02-10 cs.CV 79%

EasyTune: Efficient Step-Aware Fine-Tuning for Diffusion-Based Motion Generation

EasyTune: 为基于扩散的运动生成实现高效的步感知微调

Xiaofeng Tan, Wanjiang Weng, Haodong Lei, Hongsong Wang

机构 * Southeast University(东南大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EasyTune通过在去噪每一步进行微调,解决扩散模型在运动生成中的优化效率和内存消耗问题,并引入自我完善偏好学习机制提升训练效率。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03881 2026-02-10 cs.CV cs.AI cs.LG 79%

DiGAN: Diffusion-Guided Attention Network for Early Alzheimer's Disease Detection

DiGAN:基于扩散引导的注意力网络用于早期阿尔茨海默病检测

Maxx Richard Rahman, Mostafa Hammouda, Wolfgang Maass

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiGAN通过结合扩散建模与注意力卷积网络,有效提升了早期阿尔茨海默病检测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17616 2026-02-10 cs.CV 79%

Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints

通过谱约束的长跳连接实现稳定高效的扩散变换器

Guanjie Chen, Xinyu Zhao, Yucheng Zhou, Xiaoye Qu, Tianlong Chen, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过引入长跳连接和谱约束,Skip-DiT实现了图像和视频生成中的稳定高效扩散变换器,显著提升了训练和推理效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14639 2026-02-10 cs.CV cs.CR cs.LG 79%

Differentially Private Adaptation of Diffusion Models via Noisy Aggregated Embeddings

基于噪声聚合嵌入的差分隐私扩散模型适应

Pura Peetathawatchai, Wei-Ning Chen, Berivan Isik, Sanmi Koyejo, Albert No

机构 * Stanford University(斯坦福大学) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软公司) Google DeepMind(谷歌DeepMind) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DPAgg-TI方法,利用文本逆向技术在差分隐私约束下实现扩散模型的高效个性化,优于传统DP-SGD方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07057 2026-02-10 cs.CV 79%

RECITYGEN -- Interactive and Generative Participatory Urban Design Tool with Latent Diffusion and Segment Anything

RECITYGEN -- 交互式和生成式参与式城市设计工具与潜在扩散与分割任何物

Di Mo, Mingyang Sun, Chengxiu Yin, Runjia Tian, Yanhong Wu, Liyan Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RECITYGEN通过结合潜在扩散模型和交互式语义分割,为城市设计提供交互式生成工具,帮助公众参与城市更新项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04188 2026-02-09 cs.CV 79%

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

DiMo:用于运动生成与理解的离散扩散建模

Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

机构 * Huawei Central Media Technology Institute(华为中央媒体技术研究所) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiMo提出了一种离散扩散式框架,实现双向文本-运动理解和生成,通过迭代掩码标记细化提升运动质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10524 2026-02-09 cs.LG cs.CV 79%

Inverse problems with diffusion models: MAP estimation via mode-seeking loss

逆问题与扩散模型:通过模式寻求损失进行MAP估计

Sai Bharath Chandra Gutha, Ricardo Vinuesa, Hossein Azizpour

机构 * KTH Royal Institute of Technology, Sweden(皇家理工学院) University of Michigan, USA(密歇根大学) Science for Life Laboratory, Sweden(科学生命实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的逆问题求解方法,通过变分模式寻求损失实现高效MAP估计,提升图像恢复性能与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏