arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2603.07504 2026-03-13 cs.CV 79%

High-Fidelity Medical Shape Generation via Skeletal Latent Diffusion

通过骨骼潜在扩散实现高保真的医学形状生成

Guoqing Zhang, Jingyun Yang, Siqi Chen, Anping Zhang, Yang Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种骨骼潜在扩散框架,通过结合结构先验实现高效高保真医学形状生成,并构建了大规模MedSDF数据集以提升生成质量与效率。

Comments 11 pages, 5 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11509 2026-03-13 cs.CV 79%

Manifold-Optimal Guidance: A Unified Riemannian Control View of Diffusion Guidance

流形最优引导:扩散引导的黎曼控制视角统一观

Zexi Jia, Pengcheng Luo, Zhengyao Fang, Jinchao Zhang, Jie Zhou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出流形最优引导(MOG)和Auto-MOG,通过黎曼控制视角解决扩散引导中的几何不匹配问题,提升生成质量并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10365 2026-03-13 cs.CV 79%

Geometric Autoencoder for Diffusion Models

几何自编码器用于扩散模型

Hangyu Liu, Jianyong Wang, Yutao Sun

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出几何自编码器GAE,通过优化低维语义监督目标和潜在规范化,提升扩散模型在生成质量、压缩与稳健重建之间的平衡,实现更高效的高分辨率视觉生成。

Comments Code and models are publicly available at https://github.com/sii-research/GAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24161 2026-03-13 cs.CV 79%

GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction

GeoDiff4D: 基于几何的扩散模型用于4D头像重建

Chao Xu, Xiaochen Zhao, Xiang Deng, Jingxiang Sun, Donglin Di, Zhuo Su, Yebin Liu

机构 * Tsinghua University(清华大学) Li Auto(利亚自动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GeoDiff4D通过几何感知扩散模型,结合表面法线和表情编码器,实现了高保真的4D头像重建,提升了视觉质量和跨身份泛化能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26489 2026-03-13 cs.CV cs.LG eess.SP 79%

Contrastive Diffusion Guidance for Spatial Inverse Problems

对比扩散引导用于空间逆问题

Sattwik Basu, Chaitanya Amballa, Zhongweiyang Xu, Jorge Vančo Sampedro, Srihari Nelakuditi, Romit Roy Choudhury

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of South Carolina(南卡罗来纳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CoGuide模型,通过对比学习在平滑嵌入空间中近似似然分数,以解决空间逆问题中的非可微前向算子挑战,实现更稳定的去噪和更稳健的重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05662 2026-03-13 cs.CV 79%

InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models

InvAD: 基于逆向的无重建异常检测方法与扩散模型

Shunsuke Sakai, Xiangteng He, Chunzhi Gu, Leonid Sigal, Tatsuhito Hasegawa

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 InvAD提出了一种基于逆向的无重建异常检测方法,通过DDIM逆向推断潜在变量并利用先验分布测量偏差,实现高效且准确的异常检测。

Comments Accepted to CVPR2026. Project page: https://invad-project.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10470 2026-03-12 cs.CV 79%

Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression

用反事实对抗幻觉:基于扩散引导的扰动用于LVLM幻觉抑制

Hamidreza Dastmalchi, Aijun An, Ali Cheraghian, Hamed Barzamini

机构 * York University(约克大学) Macquarie University(麦考瑞大学) Northern Illinois University(北伊利诺伊大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CIPHER通过反事实图像扰动减少LVLM中的视觉幻觉,提升模型忠实性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10391 2026-03-12 cs.LG cs.CV 79%

Variance-Aware Adaptive Weighting for Diffusion Model Training

基于方差意识的扩散模型训练自适应加权

Nanlong Sun, Lei Shi

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于方差意识的自适应加权策略,用于改进扩散模型的训练稳定性与生成性能。

Comments 15 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10314 2026-03-12 cs.CR cs.MM cs.SD 79%

PRoADS: Provably Secure and Robust Audio Diffusion Steganography with latent optimization and backward Euler Inversion

PRoADS: 基于音频扩散模型的可证明安全且稳健的音频隐写框架:利用潜在优化和后向欧拉反演

YongPeng Yan, Yanan Li, Qiyang Xiao, Yanzhen Ren

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 PRoADS通过正交矩阵投影和潜在优化技术,在音频扩散模型中实现可证明安全且稳健的隐写,达到0.15%的低比特错误率。

Comments This paper has been accepted for presentation at the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09819 2026-03-11 cs.CV 79%

ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation

ConfCtrl: 通过置信度感知插值实现视频扩散中的精确相机控制

Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Yang Bai, Chi Zhang, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ConfCtrl通过置信度感知插值实现视频扩散中的精确相机控制,解决大视角变化下新视角生成问题,提升几何一致性与视觉合理性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09657 2026-03-11 cs.CV cs.AI cs.ET eess.IV 79%

When to Lock Attention: Training-Free KV Control in Video Diffusion

何时锁定注意力:视频扩散中的无训练KV控制

Tianyi Zeng, Jincheng Gao, Tianyi Wang, Zijie Meng, Miao Zhang, Jun Yin, Haoyuan Sun, Junfeng Jiao, Christian Claudel, Junbo Tan, Xueqian Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 KV-Lock通过动态调度KV融合比和CFG尺度,提升视频扩散模型中前景质量与背景一致性的平衡,实现无训练的高效视频编辑。

Comments 18 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09408 2026-03-11 cs.CV cs.AI cs.LG 79%

Reviving ConvNeXt for Efficient Convolutional Diffusion Models

复兴 ConvNeXt 以实现高效的卷积扩散模型

Taesung Kwon, Lorenzo Bianchi, Lennart Wittke, Felix Watine, Fabio Carrara, Jong Chul Ye, Romann Weber, Vinicius Azevedo

机构 * KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) ISTI-CNR(意大利国家研究理事会信息与自动化研究所) University of Pisa(比萨大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出全卷积扩散模型 FCDM-XL,通过使用 ConvNeXt 结构实现高效扩散模型,以更少的 FLOPs 和训练步骤达到与 DiT-XL 相当的性能。

Comments CVPR 2026. Official implementation: https://github.com/star-kwon/FCDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27602 2026-03-11 cs.CV 79%

Who Made This? Fake Detection and Source Attribution with Diffusion Features

谁制造了这个?通过扩散特征进行伪造检测和来源归因

Simone Bonechi, Paolo Andreini, Barbara Toniella Corradini

机构 * Department of Information Engineering and Mathematics, University of Siena(信息工程与数学系,锡耶纳大学) AIGO, Italian Institute of Technology(AIGO,意大利理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FRIDA通过分析扩散特征,利用k-最近邻方法和紧凑神经分类器实现伪造图像检测与来源归因,达到跨生成器检测的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24417 2026-03-11 cs.CV 79%

EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering

EasyText: 用于多语言文本渲染的可控扩散变换器

Runnan Lu, Yuxuan Zhang, Jiaming Liu, Haofan Wang, Yiren Song

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 EasyText提出了一种基于DiT的可控扩散变换器,用于多语言文本渲染,通过字符位置编码和插值技术实现精确生成,并利用大规模数据集提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01547 2026-03-11 cs.CV 79%

Semi-Supervised Biomedical Image Segmentation via Diffusion Models and Teacher-Student Co-Training

半监督生物医学图像分割:通过扩散模型和教师-学生协同训练

Luca Ciampi, Gabriele Lagani, Giuseppe Amato, Fabrizio Falchi

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的半监督生物医学图像分割框架,通过教师-学生协同训练和多轮伪标签生成策略,在有限标注数据下提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09054 2026-03-11 cs.CV 79%

Spectral-Structured Diffusion for Single-Image Rain Removal

谱结构扩散用于单图像雨去除

Yucheng Xing, Xin Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SpectralDiff通过引入结构化的频谱扰动,提升单图像雨去除的效率和性能。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08998 2026-03-11 cs.CV 79%

Diffusion-Based Authentication of Copy Detection Patterns: A Multimodal Framework with Printer Signature Conditioning

基于扩散的复制检测模式认证:一种多模态框架与打印机签名条件化

Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior

机构 * Université Lumière Lyon 2, CNRS, INSA Lyon, Universite Claude Bernard Lyon 1, LIRIS UMR5205(里摩日大学里昂2分校、法国国家科学研究中心、里昂国立应用科学学院、里昂大学克莱尔-贝尔纳分校、LIRIS UMR5205)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散的多模态认证框架,利用打印机签名条件化技术,实现对复制检测模式的高效认证,优于传统方法和深度学习方法。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08364 2026-03-10 cs.CV 79%

Diffusion-Based Data Augmentation for Image Recognition: A Systematic Analysis and Evaluation

基于扩散的数据增强用于图像识别:系统分析与评估

Zekun Li, Yinghuan Shi, Yang Gao, Dong Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UniDiffDA框架,系统分析DiffDA方法的三个核心组件,通过全面评估揭示不同策略的优劣,提供可复现的代码和配置以促进研究。

Journal ref Int J Comput Vis 134, 126 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02919 2026-03-10 cs.CV cs.AI cs.LG 79%

Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers

可解释的运动注意力图:在视频扩散变换器中进行时空定位概念

Youngjun Jun, Seil Kang, Woojung Han, Seong Jae Hwang

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种可解释的运动注意力图方法,通过时空定位运动概念,提升视频扩散变换器的可解释性与定位能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14980 2026-03-10 cs.RO cs.AI cs.CV 79%

M4Diffuser: Multi-View Diffusion Policy with Manipulability-Aware Control for Robust Mobile Manipulation

M4Diffuser:多视角扩散策略与具有操纵性意识的控制的多自由度扩散策略用于鲁棒移动操纵

Ju Dong, Lei Zhang, Liding Zhang, Yao Ling, Yu Fu, Kaixin Bai, Zoltán-Csaba Márton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院技术多模态系统部门) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 M4Diffuser通过多视角扩散策略与操纵性意识控制器实现鲁棒移动操纵,提升任务成功率与环境适应性。

Comments Project page: https://sites.google.com/view/m4diffuser, 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08135 2026-03-10 cs.CV 79%

VesselFusion: Diffusion Models for Vessel Centerline Extraction from 3D CT Images

VesselFusion:基于扩散模型的3D CT图像血管中心线提取

Soichi Mita, Shumpei Takezaki, Ryoma Bise

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VesselFusion通过扩散模型实现3D CT图像中血管中心线的提取,采用粗到细表示和投票聚合方法,提升提取精度和结果自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08020 2026-03-10 cs.CV 79%

VSDiffusion: Taming Ill-Posed Shadow Generation via Visibility-Constrained Diffusion

VSDiffusion:通过可见性约束扩散镇定模糊的阴影生成

Jing Li, Jing Zhang

机构 * East China University of Science and Technology(东华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VSDiffusion通过可见性约束扩散框架,结合多尺度结构指导和软先验图,有效生成逼真阴影,提升复杂场景下的几何一致性。

Comments 12 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07889 2026-03-10 cs.CV 79%

Structure and Progress Aware Diffusion for Medical Image Segmentation

结构与进展感知扩散用于医学图像分割

Siyuan Song, Guyue Hu, Chenglong Li, Dengdi Sun, Zhe Jin, Jin Tang

机构 * School of Artificial Intelligence(人工智能学院) School of Computer Science and Technology(计算机科学与技术学院) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SPAD方法,结合语义集中扩散和边界集中扩散,通过进展感知调度器实现医学图像分割的粗到细的扩散过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07865 2026-03-10 cs.SD cs.CV eess.AS 79%

SoundWeaver: Semantic Warm-Starting for Text-to-Audio Diffusion Serving

SoundWeaver: 语义预热启动用于文本到音频扩散服务

Ayush Barik, Sofia Stoica, Nikhil Sarda, Arnav Kethana, Abhinav Khanduja, Muchen Xu, Fan Lai

机构 * University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) Assured Intelligence, USA(Assured Intelligence)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SoundWeaver通过语义预热启动技术,提升文本到音频扩散服务的效率,减少延迟并保持音频质量。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07759 2026-03-10 cs.CV cs.AI 79%

DECADE: A Temporally-Consistent Unsupervised Diffusion Model for Enhanced Rb-82 Dynamic Cardiac PET Image Denoising

DECADE:一种用于增强Rb-82动态心脏PET图像去噪的时序一致无监督扩散模型

Yinchi Zhou, Liang Guo, Huidong Xie, Yuexi Du, Ashley Wang, Menghua Xia, Tian Yu, Ramesh Fazzone-Chettiar, Christopher Weyman, Bruce Spottiswoode, Vladimir Panin, Kuangyu Shi, Edward J. Miller, Attila Feher, Albert J. Sinusas, Nicha C. Dvornek, Chi Liu

机构 * Yale University(耶鲁大学) Yale School of Medicine(耶鲁医学院) Siemens Medical Solutions USA, Inc.(西门子医疗解决方案美国公司) Inselspital, Bern University Hospital(伯尔尼大学医院Inselspital) University of Bern(伯尔尼大学) Department of Biomedical Engineering(生物医学工程系) Department of Radiology and Biomedical Imaging(放射科和生物医学成像系) Department of Medicine (Cardiology)(医学系(心脏病学))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DECADE是一种用于增强Rb-82动态心脏PET图像去噪的无监督扩散模型,通过引入时间一致性提升去噪效果,实现高质量动态和参数图像重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07697 2026-03-10 cs.CV 79%

Learning Context-Adaptive Motion Priors for Masked Motion Diffusion Models with Efficient Kinematic Attention Aggregation

学习上下文自适应的运动先验以实现遮蔽运动扩散模型的高效运动学注意力聚合

Junkun Jiang, Jie Chen, Ho Yin Au, Jingyu Xiang

机构 * Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MMDM通过高效运动学注意力聚合机制,学习上下文自适应的运动先验,实现遮蔽运动数据的高效重建与生成。

Comments Accepted by IEEE Transactions on Multimedia. Supplementary material is included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07430 2026-03-10 cs.CV 79%

Disentangled Textual Priors for Diffusion-based Image Super-Resolution

解耦文本先验用于基于扩散的图像超分辨率

Lei Jiang, Xin Liu, Xinze Tong, Zhiliang Li, Jie Liu, Jie Tang, Gangshan Wu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DTPSR通过解耦文本先验提升基于扩散的图像超分辨率性能,引入空间层次和频率语义两个维度,实现高感知质量和强泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07361 2026-03-10 cs.LG cs.CV 79%

N-Tree Diffusion for Long-Horizon Wildfire Risk Forecasting

N-Tree Diffusion用于长周期野火风险预测

Yucheng Xing, Xin Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 N-Tree Diffusion通过共享早期去噪阶段和后期分支,提高了长周期野火风险预测的效率和准确性。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08131 2026-03-10 cs.CV 79%

Real-Time Motion-Controllable Autoregressive Video Diffusion

实时可控的自回归视频扩散

Kesen Zhao, Jiaxin Shi, Beier Zhu, Junbao Zhou, Xiaolong Shen, Yuan Zhou, Qianru Sun, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Xmax.AI Ltd(Xmax.AI有限公司) Zhejiang University(浙江大学) Singapore Management University(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 AR-Drag是一种基于强化学习的实时图像到视频生成模型,通过自回归机制和轨迹奖励模型实现高效运动控制,提升视频生成质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14357 2026-03-10 cs.CV cs.LG 79%

Vid2World: Crafting Video Diffusion Models to Interactive World Models

Vid2World: 构建视频扩散模型以交互式世界模型

Siqiao Huang, Jialong Wu, Qixing Zhou, Shangchen Miao, Mingsheng Long

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Vid2World通过因果化视频扩散模型,提升其在交互式世界建模中的可控性和生成能力,适用于机器人操作、游戏模拟和开放世界导航等多种领域。

Comments Project page: http://knightnemo.github.io/vid2world/

详情

展开后加载摘要…

URL PDF HTML 收藏