arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2302.03900 2023-02-09 cs.CV cs.AI cs.LG stat.ML 85%

Zero-shot Generation of Coherent Storybook from Plain Text Story using Diffusion Models

Hyeonho Jeong, Gihyun Kwon, Jong Chul Ye

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.16007 2023-02-09 cs.CV 85%

Improved Vector Quantized Diffusion Models

Zhicong Tang, Shuyang Gu, Jianmin Bao, Dong Chen, Fang Wen

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments update reference

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.04802 2023-01-13 cs.LG cs.CV eess.IV 85%

Diffusion-based Data Augmentation for Skin Disease Classification: Impact Across Original Medical Datasets to Fully Synthetic Images

Mohamed Akrout, Bálint Gyepesi, Péter Holló, Adrienn Poór, Blága Kincső, Stephen Solis, Katrina Cirone, Jeremy Kawahara, Dekker Slade, Latif Abid, Máté Kovács, István Fazekas

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04885 2022-12-09 cs.CV cs.CL 85%

What the DAAM: Interpreting Stable Diffusion Using Cross Attention

Raphael Tang, Linqing Liu, Akshat Pandey, Zhiying Jiang, Gefei Yang, Karun Kumar, Pontus Stenetorp, Jimmy Lin, Ferhan Ture

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments First two authors contributed equally. 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.17106 2022-12-01 cs.CV eess.IV 85%

Diffusion Probabilistic Model Made Slim

Xingyi Yang, Daquan Zhou, Jiashi Feng, Xinchao Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12572 2022-11-24 cs.CV cs.AI 85%

Plug-and-Play Diffusion Features for Text-Driven Image-to-Image Translation

Narek Tumanyan, Michal Geyer, Shai Bagon, Tali Dekel

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10950 2022-11-22 cs.CV 85%

Synthesizing Coherent Story with Auto-Regressive Latent Diffusion Models

Xichen Pan, Pengda Qin, Yuhong Li, Hui Xue, Wenhu Chen

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09795 2022-11-18 cs.CV 85%

Conffusion: Confidence Intervals for Diffusion Models

Eliahu Horwitz, Yedid Hoshen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07793 2022-11-16 eess.IV cs.CV 85%

Extreme Generative Image Compression by Learning Text Embedding from Diffusion Models

Zhihong Pan, Xin Zhou, Hao Tian

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11058 2022-10-21 cs.CV 85%

Representation Learning with Diffusion Models

Jeremias Traub

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14988 2022-09-30 cs.CV cs.LG stat.ML 85%

DreamFusion: Text-to-3D using 2D Diffusion

Ben Poole, Ajay Jain, Jonathan T. Barron, Ben Mildenhall

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments see project page at https://dreamfusion3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17775 2024-11-26 stat.ML cs.LG q-bio.BM 85%

Practical and Asymptotically Exact Conditional Sampling in Diffusion Models

Luhuan Wu, Brian L. Trippe, Christian A. Naesseth, David M. Blei, John P. Cunningham

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments Code: https://github.com/blt2114/twisted_diffusion_sampler

Journal ref NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03511 2024-07-01 cs.CV cs.LG cs.MM 85%

Kandinsky 3.0 Technical Report

Vladimir Arkhipkin, Andrei Filatov, Viacheslav Vasilev, Anastasia Maltseva, Said Azizov, Igor Pavlov, Julia Agafonova, Andrey Kuznetsov, Denis Dimitrov

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

Comments Project page: https://ai-forever.github.io/Kandinsky-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12401 2026-08-06 cs.LG cs.AI 版本更新 85%

Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation

超越狄拉克 delta:缓解强化微调中的多样性崩溃以实现多功能图像生成

Jinmei Liu, Haoru Li, Zhenhong Sun, Chaofeng Chen, Yatao Bian, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australia National University(澳大利亚国立大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学) University of Technology Sydney(技术科技大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract)

AI总结 DRIFT通过激励输出多样性缓解强化微调中的多样性崩溃,提升图像生成的多样性和任务对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21606 2026-07-27 cs.AI 新提交 85%

TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

TILT:使用模型内在奖励改进扩散模型中的组合生成

Debottam Dutta, Jaehoon Hahm, Jianchong Chen, Romit Roy Choudhury

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 研究如何改进扩散模型的组合生成,提出无训练框架TILT,通过测试时奖励对齐,将组合失败解释为分布重叠模式并定义固有奖励,产生KL约束目标及指导步骤,实验表明该方法能在保图质时提升组合对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19919 2026-07-23 cs.RO cs.LG 新提交 85%

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

扩散重滚动:用于机器人序列预测的可修正去噪

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

机构 * Agency for Defense Development(国防发展局)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 研究提出扩散重滚动框架用于机器人序列预测,能选择性重新去噪局部稳定区域,实现跨视野迭代修正。通过与其他方法对比评估,在多任务基准测试中取得更好性能,支持结构化重新去噪是可修正机器人序列生成的有效机制。

Comments Project Page: https://seonsoo-p1.github.io/DiffusionReRoll/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 85%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13955 2026-06-15 cs.LG 新提交 85%

Smoothing Dark Areas in Molecular Latent Diffusion

分子潜在扩散中的暗区平滑

Xi Wang, Jiahan Li, Yuxuan Xia, Yingcheng Wu, Shaoyi Zheng, Shengjie Wang

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract)

AI总结 针对分子潜在扩散中存在的暗区问题,提出拓扑优化VAE(TopVAE),通过训练时内化结构和化学约束,减少暗区,提升离后验鲁棒性,在QM9和GEOM-Drugs上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02884 2026-06-03 cs.LG cs.AI 85%

Are we really tilting? The mechanics of reward guidance in flow and diffusion models

我们真的在倾斜吗?流模型和扩散模型中奖励引导的机制

Sanjit Dandapanthula, Nicholas M. Boffi

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文通过高斯混合模型和二次奖励的闭式分析,揭示了奖励引导扩散中奖励黑客现象源于Doob h函数的有限粒子插件估计,并提出了无额外计算的闭式奖励阻尼调度来纠正模式内偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25210 2026-05-26 cs.LG cs.AI stat.ML 85%

Multi-Objective Learning for Diffusion Models: A Statistical Theory under Semi-Supervised Learning

扩散模型的多目标学习:半监督学习下的统计理论

Ziheng Cheng, Yixiao Huang, Hanlin Zhu, Haoran Geng, Somayeh Sojoudi, Jitendra Malik, Pieter Abbeel, Xin Guo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 针对扩散模型在多目标学习中因模型容量增大导致统计成本高的问题,提出半监督两阶段训练方法,利用未标记数据通过伪样本蒸馏,证明所需配对样本量仅取决于专家模型复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23649 2026-05-25 eess.SP math.ST stat.TH 85%

Diffusion Fluid Antenna Systems for Resilient ISAC

扩散流体天线系统用于弹性ISAC

Noor Waqar, Kai-Kit Wong, Chan-Byoung Chae, Ross Murch

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出扩散流体天线系统,利用生成式AI驱动的空间自由度选择天线端口,重塑感知特征,实现目标隐身和干扰抑制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19037 2026-05-20 math.NA cs.NA 85%

DG = FEM + flat elements, Part I: Diffusion

DG = FEM + flat elements, Part I: Diffusion

Jiří Szotkowski, Václav Kučera, Chi-Wang Shu, Antoine Quiriny, Jonathan Lambrechts, Nicolas Moës, Jean-François Remacle

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文研究了连续有限元方法(FEM)与不连续Galerkin方法(DG)在泊松问题中的联系,通过在单元界面插入消失厚度的'虚拟'元素,并修改扩散系数以证明FEM公式收敛于Babuška-Zlámal DG方法,采用梯形边积分。该方法通过简单的网格编辑和单个雅可比阈值实现,能够在不修改原有FEM代码的情况下实现DG的简单实现,并支持适应性元素级的FEM与DG切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04663 2026-05-20 cs.LG cs.AI 85%

Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design

重新思考扩散模型强化学习的设计空间:超越损失设计的似然估计的重要性

Jaemoo Choi, Yuchen Zhu, Wei Guo, Petr Molodyk, Bo Yuan, Jinbin Bai, Yi Xin, Molei Tao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Nanjing university(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文研究了扩散模型强化学习设计空间中的关键问题,通过分解策略梯度目标、似然估计器和回放采样方案三个因素,发现基于证据下界(ELBO)的模型似然估计器是实现有效、高效和稳定强化学习优化的主要因素,优于特定策略梯度损失函数的影响。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21893 2026-05-19 cs.LG cs.AI 85%

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

SIPO: 用于对齐扩散模型的人类偏好优化的稳定与改进方法

Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li

机构 * Shanghai Science and Intelligence Institute, Shanghai, China(上海科学与智能研究所) Fudan University, Shanghai, China(复旦大学) Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本研究提出SIPO框架,通过时间步感知的重要性重新加权和梯度稳定技术,解决扩散模型对齐中训练不稳定和策略偏差问题,提升了对齐效果和稳定性。

Comments This version supplements with more detailed content on reasoning and proof, additional experimental results, and ablation studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11480 2026-05-19 cs.LG 85%

Efficient Adjoint Matching for Fine-tuning Diffusion Models

高效对抗匹配用于扩散模型微调

Jeongwoo Shin, Dongsoo Shin, Yuchen Zhu, Wei Guo, Yongxin Chen, Joonseok Lee, Jaewoong Choi, Jaemoo Choi

机构 * Seoul National University(首尔国立大学) Georgia Institute of Technology(佐治亚理工学院) Sungkyunkwan University(庆尚大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出高效对抗匹配(EAM),通过改用线性基础漂移和修改终端成本,解决对抗匹配在扩散模型微调中的计算瓶颈,使训练效率提升4倍并在多个指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00975 2026-05-19 cs.LG cs.AI 85%

Forgetting is Competition: Rethinking Unlearning as Representation Interference in Diffusion Models

遗忘是竞争:重新思考扩散模型中的去学习作为表征干扰

Ashutosh Ranjan, Vivek Srivastava, Shirish Karande, Murari Mandal

机构 * TCS Research(印度 Tata Consulting Engineers 研究部) Kalinga Institute of Industrial Technology(卡林加工业技术学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出SurgUn方法,通过可控竞争而非直接删除或一对一重分配来实现扩散模型的去学习,有效平衡遗忘与保留,提升模型在版权、安全等场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16098 2026-05-18 cs.CR cs.DC 85%

PCDM: A Diffusion-Based Data Poisoning Attack Against Federated Learning Systems

PCDM:一种基于扩散的数据污染攻击对抗联邦学习系统

Wei Sun, Yijun Chen, Bo Gao, Ke Xiong, Yuwei Wang, Pingyi Fan, Khaled Ben Letaief

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出基于扩散的数据污染框架,通过Poisoning-Oriented Conditional Diffusion Model实现对联邦学习系统中局部数据污染的精细控制,同时保证攻击效果与隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11485 2026-05-18 cs.RO 85%

Coordinated Diffusion: Generating Multi-Agent Behavior Without Multi-Agent Demonstrations

协同扩散:无需多智能体演示生成多智能体行为

Lasse Peters, Laura Ferranti, Andrea Bajcsy, Javier Alonso-Mora

机构 * University of California, Berkeley(加州大学伯克利分校) Delft University of Technology(代尔夫特理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Coordinated Diffusion框架,通过用户定义的多智能体成本函数将独立训练的单智能体扩散策略耦合,无需多智能体演示数据,实现多智能体行为协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06779 2026-05-13 cs.AI 85%

VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion

VASR:基于奖励引导扩散的方差感知系统性重采样

Shivanshu Shekhar, Sagnik Mukherjee, Jia Yi Zhang, Tong Zhang

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) Department of Statistics(统计学系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出VASR方法,通过分解延续方差与残余方差,解决奖励引导扩散SMC中的快速谱系崩溃问题,提升样本质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10198 2026-05-12 cs.LG cs.AI 85%

Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models

空 SPACE:用于扩散模型概念擦除的交叉注意力稀疏性

Nicola Novello, Andrea M. Tonello

机构 * University of Klagenfurt(克雷格弗尔特大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本文提出SPACE方法,通过迭代修改交叉注意力参数实现概念擦除,提升大模型的擦除效果和鲁棒性,同时实现高稀疏性以降低存储需求。

详情

展开后加载摘要…

URL PDF HTML 收藏