arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-01 至 2025-12-01 共收录 81 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 81 篇

2504.13987 2025-12-01 cs.CV cs.AI 85%

Entropy Rectifying Guidance for Diffusion and Flow Models

熵校正引导用于扩散和流模型

Tariq Berrada Ifriqi, Adriana Romero-Soriano, Michal Drozdzal, Jakob Verbeek, Karteek Alahari

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔研究所) LJK, France(法国劳埃德-约瑟夫-克劳德实验室) McGill University(麦吉尔大学) Mila, Quebec AI institute(魁北克人工智能研究所) Canada CIFAR AI chair(加拿大 CIFAR 人工智能主席)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ERG是一种基于注意力机制变化的简单有效引导方法,能同时提升图像质量、多样性及提示一致性,适用于扩散和流模型的多种生成任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00234 2025-12-01 cs.LG cs.CV cs.NA math.NA physics.comp-ph stat.ML 85%

Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms

离散扩散模型的快速求解器:高阶算法的理论与应用

Yinuo Ren, Haoxuan Chen, Yuchen Zhu, Wei Guo, Yongxin Chen, Grant M. Rotskoff, Molei Tao, Lexing Ying

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出高阶算法用于离散扩散模型,提升推断效率和样本质量,适用于文本、图像等生成任务。

Comments Accepted at NeurIPS 2025 as a Poster (https://openreview.net/forum?id=OuklL6Q3sO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23377 2025-12-01 cs.CV 83%

DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline

DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线

Rui Zhang, Hongxia Wang, Hangqing Liu, Yang Zhou, Qiang Zeng

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。

Comments 13pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19104 2025-12-01 cs.LG eess.IV stat.ML 82%

Composition and Alignment of Diffusion Models using Constrained Learning

扩散模型的组成与对齐:基于约束学习

Shervin Khalafi, Ignacio Hounie, Dongsheng Ding, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Tennessee, Knoxville(田纳西大学,基洛那分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出了一种基于约束学习的框架,通过统一对齐和组成扩散模型,以提高生成样本的质量和符合用户需求的能力。

Comments 48 pages, 6 figures, 15 tables; Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16786 2025-12-01 cs.DC 82%

Staleness-Centric Optimizations for Parallel Diffusion MoE Inference

以 staleness 为中心的并行扩散 MoE 推理优化

Jiajun Luo, Lizhuo Luo, Jianru Xu, Jiajun Song, Rongwei Lu, Chen Tang, Zhi Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 DICE 提出了一种以 staleness 为中心的优化框架,通过交错并行性、选择性同步和条件通信减少 staleness,实现 1.26 倍速度提升并保持高质量。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00359 2025-12-01 cs.LG eess.IV 82%

Linearly Constrained Diffusion Implicit Models

线性约束扩散隐式模型

Vivek Jayaram, Ira Kemelmacher-Shlizerman, Steven M. Seitz, John Thickstun

机构 * University of Washington(华盛顿大学) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 CDIM通过动态调整投影步骤减少数量,实现快速准确解决噪声线性逆问题,适用于多种图像处理任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22896 2025-12-01 cs.CV 79%

DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking

DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li

机构 * China Agricultural University(中国农业大学) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22870 2025-12-01 cs.CV q-bio.NC 79%

Scalable Diffusion Transformer for Conditional 4D fMRI Synthesis

可扩展的扩散变换器用于条件4D fMRI合成

Jungwoo Seo, David Keetae Park, Shinjae Yoo, Jiook Cha

机构 * Seoul National University(首尔国立大学) Brookhaven National Laboratory(布鲁赫斯旺国家实验室) Seoul National Laboratory(首尔国立实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种可扩展的扩散变换器,用于条件4D fMRI合成,通过结合3D VQ-GAN和CNN-Transformer结构,实现了高精度的任务条件生成。

Comments Accepted at NeurIPS 2025 Workshop: Foundation Models for the Brain and Body. 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22759 2025-12-01 cs.CV cs.AI 79%

MammoRGB: Dual-View Mammogram Synthesis Using Denoising Diffusion Probabilistic Models

MammoRGB: 基于去噪扩散概率模型的双视角乳腺X线合成

Jorge Alberto Garza-Abdala, Gerardo A. Fumagal-González, Daly Avendano, Servando Cardona, Sadam Hussain, Eduardo de Avila-Armenta, Jasiel H. Toscano-Martínez, Diana S. M. Rosales Gurmendi, Alma A. Pedro-Pérez, Jose Gerardo Tamez-Pena

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MammoRGB利用三通道DDPM生成双视角乳腺X线图像,通过不同通道编码提升图像保真度和跨视角一致性,为数据集增强提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03143 2025-12-01 cs.CV 79%

SARD: Segmentation-Aware Anomaly Synthesis via Region-Constrained Diffusion with Discriminative Mask Guidance

SARD: 通过区域约束扩散与判别掩码引导进行的分段感知异常合成

Yanshu Wang, Xichen Xu, Xiaoning Lei, Guoyang Xie

机构 * Global Institute of Future Technology(未来技术全球研究所) Shanghai Jiao Tong University(上海交通大学) Department of Intelligent Manufacturing(智能制造系) Contemporary Amperex Technology Co.,Ltd(当代电子技术有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SARD通过区域约束扩散与判别掩码引导方法,提升工业异常检测系统的鲁棒性,实现更精确的像素级异常合成。

Comments Accepted by The 2025 International Conference on Machine Intelligence and Nature-InspireD Computing (MIND)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11764 2025-12-01 cs.CV eess.IV 79%

DiffFuSR: Super-Resolution of all Sentinel-2 Multispectral Bands using Diffusion Models

DiffFuSR:利用扩散模型实现所有Sentinel-2多光谱波段的超分辨率处理

Muhammad Sarmad, Arnt-Børre Salberg, Michael Kampffmeyer

机构 * Norwegian Computing Center(挪威计算中心) Department of Physics and Technology, UiT The Arctic University of Norway(物理与技术系,UiT 北极大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffFuSR通过扩散模型和融合策略实现Sentinel-2多光谱波段的超分辨率处理,提升反射率保真度和光谱一致性。

Comments Accepted for Publication at IEEE TRANSACTIONS ON GEOSCIENCE AND REMOTE SENSING (TGRS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22488 2025-12-01 cs.CV 79%

AI killed the video star. Audio-driven diffusion model for expressive talking head generation

AI杀死了视频明星。用于表达性说话头生成的音频驱动扩散模型

Baptiste Chopin, Tashvik Dhamija, Pranav Balaji, Yaohui Wang, Antitza Dantcheva

机构 * Centre INRIA d’Université Côte d’Azur(INRIA中心,坎特伯雷大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Dimitra++通过音频驱动的扩散模型生成具有真实嘴唇运动、面部表情和头部姿态的说话头,优于现有方法。

Comments arXiv admin note: text overlap with arXiv:2502.17198

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22456 2025-12-01 cs.CV 79%

ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models

ITS3D: 推理时缩放用于文本引导的3D扩散模型

Zhenglin Zhou, Fan Ma, Xiaobo Xia, Hehe Fan, Yi Yang, Tat-Seng Chua

机构 * ReLER, Zhejiang University(浙江大学ReLER实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ITS3D通过优化问题和验证器引导搜索算法,提升文本引导的3D扩散模型生成质量。

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD 79%

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19229 2025-12-01 cs.CV cs.AI 79%

Learning Plug-and-play Memory for Guiding Video Diffusion Models

学习插件式记忆以指导视频扩散模型

Selena Song, Ziming Xu, Zijun Zhang, Kun Zhou, Jiaxian Guo, Lianhui Qin, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiT-Mem,通过学习插件式记忆增强视频扩散模型的物理规则遵循和视频保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17138 2025-12-01 cs.CV 79%

One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution

一步扩散变换器用于可控的现实世界图像超分辨率

Yushun Fang, Yuxiang Chen, Shibo Yin, Qiang Hu, Jiangchao Yao, Ya Zhang, Xiaoyun Zhang, Yanfeng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc(小红书公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ODTSR通过噪声混合视觉流和保真度感知对抗训练,实现一步扩散变换器在现实世界图像超分辨率中的保真度与可控性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01873 2025-12-01 cs.CV 79%

DiffusionFF: A Diffusion-based Framework for Joint Face Forgery Detection and Fine-Grained Artifact Localization

DiffusionFF: 一种基于扩散的联合人脸伪造检测与细粒度特征定位框架

Siran Peng, Haoyuan Zhang, Li Gao, Tianshuo Zhang, Xiangyu Zhu, Bao Li, Weisong Zhao, Zhen Lei

机构 * MAIS, CASIA(CASIA人工智能研究所) SAI, UCAS(UCAS智能信息学院) CMFT(计算机视觉与模式识别技术研究所) IIE, CAS(中国科学院信息工程研究所) SCS, UCAS(UCAS安全学院) CAIR, HKISI, CAS(中国科学院自动化研究所) SCSE, FIE, M.U.S.T(慕苏尔科技大学安全与电子工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffusionFF通过结合预训练的伪造检测器和去噪扩散模型,实现人脸伪造检测与细粒度特征定位,提升检测能力和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17511 2025-12-01 cs.CV 79%

Accelerating Parallel Diffusion Model Serving with Residual Compression

通过残差压缩加速并行扩散模型服务

Jiajun Luo, Yicheng Xiao, Jianru Xu, Yangxiu You, Rongwei Lu, Chen Tang, Jingyan Jiang, Zhi Wang

机构 * Southern University of Science and Technology(南方科技大学) Jiangnan University(江南大学) Shenzhen Technology University(深圳技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CompactFusion通过残差压缩技术提升并行扩散模型服务效率,实现3倍加速并显著提高生成质量。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07073 2025-12-01 cs.CV cs.LG 79%

Discovering Concept Directions from Diffusion-based Counterfactuals via Latent Clustering

通过潜在聚类发现扩散基于的反事实概念方向

Payal Varshney, Adriano Lucieri, Christoph Balada, Andreas Dengel, Sheraz Ahmed

机构 * German Research Center for Artificial Intelligence GmbH (DFKI)(德国人工智能研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CDLC方法,通过潜在聚类提取概念方向,减少存储需求并加速概念发现,适用于高风险领域和多样化数据模态。

Comments Accepted at Pattern Recognition Letters Journal (14 Pages)

Journal ref Special Section on the 27th International Conference on Pattern Recognition (ICPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23061 2025-12-01 physics.soc-ph cs.SI 78%

The impact of anticonformity on the diffusion of innovation -- insights from the q-voter model

反从众对创新扩散的影响——来自q-投票模型的洞察

Angelika Abramiuk-Szurlej

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过扩展q-投票模型引入反从众行为,研究其对创新扩散的影响,发现反从众能加速早期采用并促进成功扩散,具有实际应用价值。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22970 2025-12-01 physics.ao-ph 78%

Technical Report: Towards Unified Diffusion Models for Multi-Model Climate Emulation at Scale

技术报告:迈向大规模多模型气候模拟的统一扩散模型

Francesco Immorlano, Elijah Tavares, Felix Draxler, Padhraic Smyth, Pierre Gentine, Stephan Mandt

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出统一扩散模型,通过学习多个气候模型和排放情景的共享分布模式,实现大规模多模型气候模拟,提高不确定性量化和处理效应分析的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22773 2025-12-01 cs.RO cs.AI 78%

CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance

CAPE:通过近端模式扩展实现上下文感知的扩散策略用于避障

Rui Heng Yang, Xuan Zhao, Leo Maxime Brunswic, Montgomery Alban, Mateo Clemente, Tongtong Cao, Jun Jin, Amir Rasouli

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) Huawei(华为) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 CAPE通过近端模式扩展实现上下文感知的扩散策略,提升避障任务中轨迹生成的泛化能力与碰撞规避性能。

Comments 4 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04966 2025-12-01 cs.SD cs.AI eess.AS 78%

LAPS-Diff: A Diffusion-Based Framework for Singing Voice Synthesis With Language Aware Prosody-Style Guided Learning

LAPS-Diff: 一种基于扩散的歌唱语音合成框架,具有语言感知的语调风格引导学习

Sandipan Dhar, Mayank Gupta, Preeti Rao

机构 * Department of Electrical Engineering, Indian Institute of Technology, Bombay.(电子工程系,印度理工学院,博亚姆)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LAPS-Diff通过语言感知嵌入和语音风格引导学习,提升低资源环境下印地语歌唱语音合成的质量。

Comments 10 pages, 5 figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04208 2025-12-01 cond-mat.stat-mech 78%

Diffusion in a wedge geometry: First-Passage Statistics under Stochastic Resetting

在楔形几何中扩散:在随机重置下的首次通过统计

Fazil Najeeb, Arnab Pal, V. V. Prasad

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究在楔形几何中随机重置对扩散过程的影响,分析首次通过统计特性及重置对吸收或逃逸速率的增强作用。

Comments 10 pages, 7 figures, version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01718 2025-12-01 cs.SI 78%

A Novel Dynamic Epidemic Model for Successive Opinion Diffusion in Social Networks

一种用于社交网络中连续意见扩散的新型动态流行病模型

Bin Han, Fabienne Renckens, C. Clark Cao, Hans D. Schotten

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种新型动态流行病模型,用于研究社交网络中连续意见扩散,通过考虑社会距离影响和谣言传播对网络结构的影响,揭示意见扩散动态及社会极化机制。

Comments To appear in IEEE GLOBECOM 2025, minor corrections in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22293 2025-12-01 cs.SD cs.LG eess.AS eess.SP 78%

GLA-Grad++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis

GLA-Grad++: 一种改进的Griffin-Lim引导扩散模型用于语音合成

Teysir Baoueb, Xiaoyu Bie, Mathieu Fontaine, Gaël Richard

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 GLA-Grad++通过改进的Griffin-Lim算法优化语音合成,提升生成效率和稳定性,尤其在域外场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22156 2025-12-01 math.PR math.FA 78%

A non-canonical diffusion on the Sierpiński carpet

Sierpiński地毯上的非标准扩散过程

Shiping Cao, Hua Qiu, Bingshen Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种在Sierpiński地毯上满足亚高斯热核估计的非标准扩散过程,结合了欧几里得度量与自相似测度。

Comments 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22146 2025-12-01 cs.CL 78%

C$^2$DLM: Causal Concept-Guided Diffusion Large Language Models

C$^2$DLM: 基于因果概念的扩散大语言模型

Kairong Han, Nuanqiao Shan, Ziyu Zhao, Zijing Hu, Xinpeng Dong, Junjian Ye, Lujia Pan, Fei Wu, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Noah’s Ark Lab, Huawei Technologies(华为技术有限公司诺亚实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 C$^2$DLM通过引入因果概念引导机制,提升大语言模型在推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21746 2025-12-01 cs.CL 78%

DELTA: Language Diffusion-based EEG-to-Text Architecture

DELTA: 基于语言扩散的EEG到文本架构

Mingyu Jeon, Hyobin Kim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DELTA通过结合残差向量量化和语言扩散模型,提升了EEG到文本的语义对齐和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17741 2025-12-01 cs.LG stat.ML 78%

Diffusion Models are Molecular Dynamics Simulators

扩散模型是分子动力学模拟器

Justin Diamond, Markus Lill

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究证明扩散模型可作为分子动力学模拟器,通过学习分数与能量梯度建立精确对应,实现数据驱动的分子动力学模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏