arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-01 至 2026-01-01 共收录 50 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 50 篇

2512.24195 2026-01-01 cs.CV 83%

CorGi: Contribution-Guided Block-Wise Interval Caching for Training-Free Acceleration of Diffusion Transformers

CorGi:基于贡献的块级区间缓存用于无训练加速扩散变换器

Yonglak Son, Suhyeok Kim, Seungryong Kim, Young Geun Kim

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 CorGi通过块级区间缓存减少DiT去噪过程中的冗余计算,提升推理速度并保持生成质量,CorGi+进一步优化了文本到图像任务中的注意力更新。

Comments 16 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24138 2026-01-01 cs.LG cs.AI cs.CV 83%

GARDO: Reinforcing Diffusion Models without Reward Hacking

GARDO:无需奖励黑客的扩散模型强化

Haoran He, Yuxiao Ye, Jie Liu, Jiajun Liang, Zhiyong Wang, Ziyang Yuan, Xintao Wang, Hangyu Mao, Pengfei Wan, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技) CUHK MMLab(港中文大学MMLab) The University of Edinburgh(爱丁堡大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 GARDO通过自适应正则化和多样性增强,有效缓解扩散模型中的奖励黑客问题,提升生成多样性与样本效率。

Comments 17 pages. Project: https://tinnerhrhe.github.io/gardo_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24927 2026-01-01 stat.ML cs.LG math.ST stat.TH 82%

Are First-Order Diffusion Samplers Really Slower? A Fast Forward-Value Approach

一阶扩散采样器真的更慢吗?一种快速前向值方法

Yuchen Jiao, Na Li, Changxiao Cai, Gen Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出了一种无训练的一阶扩散采样器,通过前向值评估优化,提高样本质量并优于高阶采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24847 2026-01-01 cs.LG physics.ao-ph 82%

AODDiff: Probabilistic Reconstruction of Aerosol Optical Depth via Diffusion-based Bayesian Inference

AODDiff:基于扩散的贝叶斯推断的气溶胶光学深度概率重建

Linhao Fan, Hongqiang Fang, Jingyang Dai, Yong Jiang, Qixing Zhang

机构 * State Key Laboratory of Fire Science(火灾科学国家重点实验室) University of Science and Technology of China(中国科学技术大学) Fire Research Division(火灾研究部) National Institute of Standards and Technology(美国国家标准与技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 AODDiff通过扩散-贝叶斯推断实现气溶胶光学深度的概率重建,具备高空间光谱保真度和不确定性量化能力。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24948 2026-01-01 cs.CV cs.LG 79%

ProDM: Synthetic Reality-driven Property-aware Progressive Diffusion Model for Coronary Calcium Motion Correction in Non-gated Chest CT

ProDM:合成现实驱动的属性感知渐进扩散模型用于非门控胸部CT中的冠状动脉钙运动校正

Xinran Gong, Gorkem Durak, Halil Ertugrul Aktas, Vedat Cicek, Jinkui Hao, Ulas Bagci, Nilay S. Shah, Bo Zhou

机构 * Department of Radiology, Northwestern University, Chicago, IL, USA College of Computing, Georgia Institute of Technology, Atlanta, GA, USA Department of Biomedical Engineering, Northwestern University, Evanston, IL, USA Department of Cardiology, Northwestern University, Chicago, IL, USA Department of Preventive Medicine, Northwestern University, Chicago, IL, USA

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProDM通过属性感知渐进校正扩散模型,有效校正非门控胸部CT中的运动伪影,提升冠状动脉钙评分的准确性与临床实用性。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24499 2026-01-01 cs.CR cs.CV 79%

Training-Free Color-Aware Adversarial Diffusion Sanitization for Diffusion Stegomalware Defense at Security Gateways

无需训练的色感知对抗扩散净化用于安全网关的扩散隐写术防御

Vladimir Frants, Sos Agaian

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的对抗扩散净化方法,通过中和隐藏负载而非检测来防御扩散隐写术,有效降低安全网关的威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24473 2026-01-01 cs.CV cs.AI eess.IV 79%

F2IDiff: Real-world Image Super-resolution using Feature to Image Diffusion Foundation Model

F2IDiff: 利用特征到图像扩散基础模型进行现实世界图像超分辨率

Devendra K. Jangid, Ripon K. Saha, Dilshan Godaliyadda, Jing Li, Seok-Jun Lee, Hamid R. Sheikh

机构 * MPI Lab, Samsung Research America(Samsung Research America研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 F2IDiff通过使用低层次特征条件的扩散模型提升现实世界图像超分辨率性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24227 2026-01-01 cs.CV 79%

Mirage: One-Step Video Diffusion for Photorealistic and Coherent Asset Editing in Driving Scenes

Mirage: 驾驶场景中光实且一致的资产编辑一步视频扩散

Shuyun Wang, Haiyang Sun, Bing Wang, Hangjun Ye, Xin Yu

机构 * The University of Queensland(昆士兰大学) Xiaomi EV(小米电动车)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Mirage提出了一种用于驾驶场景中光实且一致的资产编辑的一步视频扩散模型,通过引入时序无关的潜在特征和两阶段数据对齐策略,提升了视觉保真度和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24165 2026-01-01 cs.CV 79%

DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models

DiffThinker: 向基于扩散模型的生成多模态推理迈进

Zefeng He, Xiaoye Qu, Yafu Li, Tong Zhu, Siyuan Huang, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffThinker通过基于扩散模型的生成方法,在多模态推理任务中实现了更高效的视觉推理和更精确的空间处理,显著优于现有模型。

Comments Project page: https://diffthinker-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24111 2026-01-01 cs.CV cs.RO 79%

Guided Diffusion-based Generation of Adversarial Objects for Real-World Monocular Depth Estimation Attacks

引导扩散生成对抗性物体用于现实世界单目深度估计攻击

Yongtao Chen, Yanbo Wang, Wentao Zhao, Guole Shen, Tianchen Deng, Jingchuan Wang

机构 * School of Automation and Intelligent Sensing, Institute of Medical Robotics, Shanghai Jiao Tong University(自动化与智能感知学院、医疗机器人研究院、上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的生成对抗攻击框架,通过扩散模型生成自然且场景一致的对抗性物体,以提升自动驾驶系统中单目深度估计的对抗攻击效果和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24035 2026-01-01 cs.CV 79%

Reinforced Diffusion: Learning to Push the Limits of Anisotropic Diffusion for Image Denoising

强化扩散:学习推动各向异性扩散的极限以实现图像去噪

Xinran Qin, Yuhui Quan, Ruotao Xu, Hui Ji

机构 * School of Computer Science and Engineering at South China University of Technology(华南理工大学计算机科学与工程学院) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于强化学习的可训练各向异性扩散框架,通过深度Q学习优化扩散过程,提升图像去噪性能,优于传统方法并可与深度CNN方法竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20000 2026-01-01 cs.CV 79%

Few-Shot-Based Modular Image-to-Video Adapter for Diffusion Models

基于少样本的模块化图像到视频适配器用于扩散模型

Zhenhao Li, Shaohan Yi, Zheng Liu, Leonartinus Gao, Minh Ngoc Le, Ambrose Ling, Zhuoran Wang, Md Amirul Islam, Zhixiang Chi, Yuanhao Yu

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) University of Waterloo(滑铁卢大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MIVA,一种轻量级模块化适配器,用于在扩散模型中实现更精确的运动控制,同时保持或提升生成质量。

Comments GitHub page: https://github.com/yishaohan/MIVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01085 2026-01-01 cs.CV 79%

Bidirectional Sparse Attention for Faster Video Diffusion Training

双向稀疏注意力用于更快的视频扩散训练

Chenlu Zhan, Wen Li, Chuyu Shen, Jun Zhang, Suhui Wu, Hao Zhang

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双向稀疏注意力框架,通过动态稀疏化查询和键值对,显著提升视频扩散模型的训练效率,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22731 2026-01-01 cs.MM 79%

GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation

GestureHYDRA: 通过混合模态扩散变换器和级联同步检索增强生成进行语义同步手势合成

Quanwei Yang, Luying Huang, Kaisiyuan Wang, Jiazhi Guan, Shengyi He, Fengguo Li, Hang Zhou, Lingyun Yu, Yingying Li, Haocheng Feng, Hongtao Xie

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 GestureHYDRA通过混合模态扩散变换器和级联同步检索增强生成技术,实现具有明确语义的手势合成,提升手势生成的准确性和效率。

Comments 10 pages, 5 figures, Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15159 2026-01-01 cs.CV 79%

OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization

OnlineVPO: 对齐视频扩散模型与在线视频中心偏好优化

Jiacheng Zhang, Jie Wu, Weifeng Chen, Yatai Ji, Xuefeng Xiao, Weilin Huang, Kai Han

机构 * The University of Hong Kong(香港大学) ByteDance Project Page(字节跳动项目)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OnlineVPO通过改进反馈源和调节方法,提出一种针对视频扩散模型的高效偏好学习框架,提升视频生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25014 2026-01-01 cs.LG cs.CC 78%

Diffusion Language Models are Provably Optimal Parallel Samplers

扩散语言模型是可证明最优的并行采样器

Haozhe Jiang, Nika Haghtalab, Lijie Chen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文证明了通过链式思维和修订,扩散语言模型能够以最优步骤和空间复杂度模拟并行采样算法,从而提升其作为高效并行采样器的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24813 2026-01-01 physics.flu-dyn cs.LG 78%

Learning Temporally Consistent Turbulence Between Sparse Snapshots via Diffusion Models

通过扩散模型学习稀疏快照间的时序一致湍流

Mohammed Sardar, Małgorzata J. Zimoń, Samuel Draycott, Alistair Revell, Alex Skillen

机构 * School of Engineering, The University of Manchester(工程学院,曼彻斯特大学) School of Mathematics, The University of Manchester(数学学院,曼彻斯特大学) IBM Research Europe, Daresbury, Warrington(IBM欧洲研究院,达尔斯伯里,沃林顿)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出通过扩散模型在稀疏快门间重建湍流动力学,验证了其在二维柯尔莫哥洛夫流和三维凯尔文-赫姆霍兹不稳定性中的有效性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24769 2026-01-01 physics.flu-dyn 78%

On Prats' problem with anomalous diffusion

关于Prats问题中的异常扩散

A. Barletta

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究重新考虑Prats问题,通过引入时间依赖的质量扩散率,探讨了异常扩散对流体稳定性的影响,并分析了亚扩散过程的不稳定性转变。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24715 2026-01-01 cs.IR 78%

MDiffFR: Modality-Guided Diffusion Generation for Cold-start Items in Federated Recommendation

MDiffFR: 联邦推荐中基于模态引导的扩散生成用于冷启动项

Kang Fu, Honglei Zhang, Xuechao Zou, Yidong Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 MDiffFR通过联邦推荐中的模态引导扩散生成方法,解决冷启动项的嵌入对齐问题,提升推荐效果与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24650 2026-01-01 math.AP cs.NA math.NA 78%

A unified spatiotemporal formulation with physics-preserving structure for time-dependent convection-diffusion problems

一种具有物理保持结构的统一时空 formulation 用于时间依赖的对流-扩散问题

James H. Adler, Xiaozhe Hu, Seulip Lee

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种统一的四维时空 formulation,用于时间依赖的对流-扩散问题,通过引入时间作为额外坐标并利用外微积分,实现了对物理结构的保持,并证明了其收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24566 2026-01-01 cond-mat.soft physics.bio-ph 78%

Dynamics of Interfacial Diffusion Control in Amphiphilic Lipid-Coated Micro-Particles for Stochastic Release Systems

两亲性脂质包覆微粒在随机释放系统中界面扩散控制的动力学

Joonggwon Kim, Dogyun Byeon

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过分析两亲性脂质包覆微粒在随机释放系统中的界面扩散控制,揭示了包覆结构对药物释放动力学的影响,发现包覆颗粒能延长释放时间分布并降低有效扩散性。

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23358 2026-01-01 physics.comp-ph cs.NA math.NA 78%

A space-time extension of a conservative two-fluid cut-cell method for moving diffusion problems

一种用于移动扩散问题的保守两流体切割单元方法的空间-时间扩展

Louis Libat, Can Selçuk, Eric Chénier, Vincent Le Chenadec

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种用于移动扩散问题的保守两流体空间-时间切割单元方法,通过局部几何权重和界面耦合算子实现守恒性,验证了其在复杂拓扑变化下的鲁棒性和高精度

Comments 25 pages, 11 figures. v2: Minor editorial corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22535 2026-01-01 cs.NI 78%

A Lightweight Coordinate-Conditioned Diffusion Approach for 6G C-V2X Radio Environment Maps

一种轻量级的坐标条件扩散方法用于6G C-V2X无线环境地图

Liu Cao, Zhaoyu Liu, Dongyu Wei, Yuan Yang, Yukun Pan, Lyutianyang Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种轻量级坐标条件扩散模型,用于生成动态高保真的6G C-V2X无线环境地图,以提高通信效率并减少物理层问题。

Comments 5 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16614 2026-01-01 cs.LG cond-mat.mtrl-sci 78%

CrystalDiT: A Diffusion Transformer for Crystal Generation

CrystalDiT:一种用于晶体生成的扩散变换器

Xiaohan Yi, Guikun Xu, Xi Xiao, Zhong Zhang, Liu Liu, Yatao Bian, Peilin Zhao

机构 * Xiaohan Yi 1,2(西安电子科技大学) Guikun Xu 3(清华大学) Zhong Zhang 2(西安电子科技大学) Liu Liu 2(西安电子科技大学) Yatao Bian 4(北京大学) Xi Xiao 1(西安电子科技大学) Peilin Zhao 3(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 CrystalDiT通过简单架构在晶体生成中实现更高性能,优于现有复杂方法。

Comments 18 pages, 18 figures. Code available at https://github.com/hanyi2021/CrystalDiT.git. Updated to remove copyright notice

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.00455 2026-01-01 math.AP 78%

Nonisothermal Richards flow in porous media with cross diffusion

非等温多孔介质中具有交叉扩散的Richard方程

Esther S. Daus, Josipa Pina Milišić, Nicola Zamponi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了非等温多孔介质中两相流的弱熵解存在性,考虑了温度梯度和交叉扩散效应,并通过变分方法和紧致性理论推导先验估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23512 2026-01-01 cs.CL cs.AI 67%

UniHetero: Could Generation Enhance Understanding for Vision-Language-Model at Large Data Scale?

UniHetero:生成能否在大规模数据下增强视觉-语言模型的理解?

Fengjiao Chen, Minhao Jing, Weitao Lu, Yan Feng, Xiaoyu Li, Xuezhi Cao

机构 * Meituan, Beijing, China(美团,北京,中国)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 UniHetero通过大规模预训练探索生成对视觉-语言模型理解的增强作用,发现语义层面生成有效,而像素层面生成会导致理解性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25034 2026-01-01 cs.LG cs.AI cs.CV cs.NE 57%

Generative Classifiers Avoid Shortcut Solutions

生成分类器避免捷径解法

Alexander C. Li, Ananya Kumar, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 生成分类器通过建模所有特征避免捷径解法,提升在分布偏移下的性能。

Comments ICLR 2025. Code: https://github.com/alexlioralexli/generative-classifiers

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24271 2026-01-01 cs.CV cs.AI 57%

Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation

驯服幻觉:通过反事实视频生成提升MLLMs的视频理解

Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu, Xiangxiang Chu, Sheng Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Beihang University(北航) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 通过反事实视频生成和对比训练,提升MLLMs对视频的理解能力并减少幻觉。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24026 2026-01-01 cs.CV cs.AI 57%

PipeFlow: Pipelined Processing and Motion-Aware Frame Selection for Long-Form Video Editing

PipeFlow: 管道处理与运动感知帧选择用于长格式视频编辑

Mustafa Munir, Md Mostafijur Rahman, Kartikeya Bhardwaj, Paul Whatmough, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 PipeFlow通过运动感知帧选择和流水线任务调度,实现长格式视频编辑的高效处理,相比现有方法速度提升达9.6至31.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23667 2026-01-01 cs.CV 57%

IDT: A Physically Grounded Transformer for Feed-Forward Multi-View Intrinsic Decomposition

IDT: 一种物理基础的Transformer用于前馈多视角内在分解

Kang Du, Yirui Guan, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 IDT通过基于Transformer的注意力机制实现多视角内在图像分解,采用物理基础模型分离材料和照明效应,提升多视角一致性。

Comments 10 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏