arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2608.07430 2026-08-10 cs.LG cs.AI 新提交 87%

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

扩散大语言模型作为目标与对抗者:机制性安全漏洞利用

Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06210 2026-08-07 cs.RO 新提交 87%

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations

VIDP:用于柔顺机器人操作的可变阻抗扩散策略(Variable Impedance Diffusion Policy)

Hisham Khalil, Neil Fernandes, Thomas M. Kwok, Hsiu-Chin Lin, Yue Hu

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 该研究针对接触丰富的机器人操作问题,提出基于模仿学习的可变阻抗控制框架VIDP,利用TP-DAMM从多样本演示中提取物理一致的轨迹分布,无需力传感器即可联合预测位姿与柔顺性,在真实实验中任务成功率及力、跟踪误差表现均优于基线方法。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 87%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23626 2026-06-23 cs.LG cs.AI 新提交 87%

DiT-Reward: Generative Representations for Text-to-Image Reward Modeling

DiT-Reward:文本到图像奖励建模的生成式表示

Yuanming Yang, Guoqing Ma, Bo Wang, Yuan Zhang, Wei Tang, Chenyi Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy, JD.com(京东探索研究院,京东) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Peking University(北京大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);image generation(abstract)

AI总结 提出DiT-Reward,利用预训练文本到图像扩散Transformer的生成表示进行奖励预测,在多个偏好基准上超越HPSv3,并实现1.65倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 87%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17353 2026-06-16 cs.LG cs.AI 版本更新 87%

Learning Permutation Distributions via Reflected Diffusion on Ranks

通过秩上的反射扩散学习排列分布

Sizhuang He, Yangtian Zhang, Shiyang Zhang, David van Dijk

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Soft-Rank Diffusion框架,通过将排列松弛为软秩实现平滑扩散,并引入上下文广义Plackett-Luce去噪器,在排序和组合优化任务上优于现有扩散方法。

Comments 18 pages including the appendix, 7 figures, 9 tables, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13740 2026-06-15 cs.LG 新提交 87%

Efficient On-Device Diffusion LLM Inference with Mobile NPU

基于移动NPU的高效设备端扩散大语言模型推理

Tuowei Wang, Yanfan Sun, Ju Ren

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出首个NPU感知推理框架Diffusion-LLM-on-NPU,通过多块推测解码、双路径渐进修正和交换优化内存运行时,在移动设备上加速扩散大语言模型推理,相比CPU基线实现17-42倍延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07152 2026-06-02 cs.MA 87%

Agents of Diffusion: Enhancing Diffusion Language Models with Multi-Agent Reinforcement Learning for Structured Data Generation (Extended Version)

扩散代理:利用多智能体强化学习增强扩散语言模型以生成结构化数据(扩展版)

Aja Khanal, Kaushik T. Ranade, Rishabh Agrawal, Kalyan S. Basu, Apurva Narayan

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Agents of Diffusion (AoD)框架,通过多智能体强化学习结合扩散语言模型与自回归模型的推理能力,实现高语义新颖性和结构保真度的结构化数据生成。

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26756 2026-05-29 cs.LG 87%

Localizing Memorized Regions in Diffusion Models via Coordinate-Wise Curvature Differences

通过坐标曲率差异定位扩散模型中的记忆区域

Gwangho Kim, Sungyoon Lee

机构 * Department of Computer Science, Hanyang University, Seoul, South Korea(首尔国立大学计算机科学系)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出基于坐标曲率差异的方法,通过减去欠拟合基线的曲率来隔离过拟合驱动的记忆,从而在扩散模型中定位记忆区域,并在Stable Diffusion上优于先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02112 2026-05-22 cs.LG cs.AI cs.CL 87%

Unifying Masked Diffusion Models with Various Generation Orders and Beyond

统一多种生成顺序及超越的掩码扩散模型

Chunsan Hong, Sanghyun Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国延世大学人工智能研究生院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Order-Expressive Masked Diffusion Model (OeMDM)和Learnable-Order Masked Diffusion Model (LoMDM),统一了不同生成顺序的扩散生成过程,并通过单目标学习生成顺序和扩散骨干,提升了文本生成性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20235 2026-05-21 cs.LG cs.AI 87%

Provably Learning Diffusion Models under the Manifold Hypothesis: Collapse and Refine

在流形假设下证明学习扩散模型:坍缩与细化

Wei Huang, Andi Han, Mingyuan Bai, Huanjian Zhou, Qixin Zhang, Taiji Suzuki, Kenji Fukumizu

机构 * RIKEN AIP & The Institute of Statistical Mathematics(日本理化学研究所AIP及统计数学研究所) University of Sydney(悉尼大学) Agency for Science, Technology and Research & The Institute of Statistical Mathematics(科技研究局及统计数学研究所) The University of Tokyo(东京大学) Nanyang Technological University(南洋理工大学) The Institute of Statistical Mathematics(统计数学研究所)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文在流形假设下研究扩散模型的学习问题,提出了一种由得分函数几何特性驱动的坍缩与细化机制,并通过Score-induced Latent Diffusion模型验证了其理论预测,证明样本复杂性依赖于内在维度而非外在维度。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06462 2026-05-20 cs.CL cs.LG 87%

Diffusion-State Policy Optimization for Masked Diffusion Language Models

扩散状态策略优化用于掩码扩散语言模型

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Diffusion-State Policy Optimization(DiSPO),一种用于掩码扩散语言模型的插件信用分配层,通过直接优化中间填充决策来改进生成过程,实验表明其在数学和规划基准测试中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18775 2026-05-20 cs.IR cs.AI 87%

Query-Aware Flow Diffusion for Graph-Based RAG with Retrieval Guarantees

基于查询意识的流扩散图基RAG系统:具有检索保证

Zhuoping Zhou, Davoud Ataee Tarzanagh, Sima Didari, Wenjun Hu, Baruch Gutow, Oxana Verkholyak, Masoud Faraki, Heng Hao, Hankyu Moon, Seungjai Min

机构 * Samsung SDS Research America(三星SDS美国研究院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出了一种无需训练的Query-Aware Flow Diffusion RAG(QAFD-RAG)系统,通过动态适应查询语义来改进图基RAG系统的检索能力,提供了首次统计保证,证明在弱信号-噪声条件下,QAFD-RAG能够以高概率恢复相关子图。

Comments Published at the International Conference on Learning Representations (ICLR) 2026. 38 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02161 2026-05-19 cs.LG 87%

LLM-TabLogic: Preserving Inter-Column Logical Relationships in Synthetic Tabular Data via Prompt-Guided Latent Diffusion

LLM-TabLogic: 通过提示引导的潜在扩散模型在合成表格数据中保留列间逻辑关系

Yunbo Long, Liming Xu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出LLM-TabLogic方法,利用大语言模型推理捕捉表格列间的复杂逻辑关系,并通过Score-based Diffusion模型在潜在空间中生成数据,以在不需领域知识的情况下有效保持合成表格数据中的列间关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22801 2026-05-19 cs.RO cs.AI cs.LG 87%

Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving

释放扩散模型在端到端自动驾驶中的潜力

Yinan Zheng, Tianyi Tan, Bin Huang, Enguang Liu, Ruiming Liang, Jianlin Zhang, Jianwei Cui, Guang Chen, Kun Ma, Hangjun Ye, Long Chen, Ya-Qin Zhang, Xianyuan Zhan, Jingjing Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文通过大规模实车数据和道路测试,系统研究了扩散模型在端到端自动驾驶中的规划能力,提出Hyper Diffusion Planner框架,实现10倍性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07799 2026-05-19 cs.CL cs.AI 87%

Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models

基于图扩散模型的多LLM代理通信拓扑动态生成

Eric Hanchen Jiang, Mengting Li, Guancheng Wan, Sophia Yin, Yuchen Wu, Xiao Liang, Xinfeng Li, Yizhou Sun, Wei Wang, Kai-Wei Chang, Ying Nian Wu

机构 * University of California Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Guided Topology Diffusion框架,通过迭代构建过程生成适应任务需求的高效通信拓扑,优于现有方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27952 2026-05-01 eess.IV cs.IT cs.LG math.IT 87%

Diffusion-OAMP for Joint Image Compression and Wireless Transmission

扩散-OAMP用于联合图像压缩和无线传输

Wentao Hou, Yimin Bai, Zelei Luo, Jiadong Hong, Lei Liu

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Diffusion-OAMP,将预训练扩散模型嵌入OAMP算法,实现联合图像压缩与无线传输,实验显示其在不同压缩比和噪声水平下表现优异。

Comments 6 pages, 5 figures, 2 tables, submitted for a possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23609 2026-04-28 cs.RO 87%

Tube Diffusion Policy: Reactive Visual-Tactile Policy Learning for Contact-rich Manipulation

管扩散策略:面向富接触操作的反应式视觉-触觉策略学习

Teng Xue, Alberto Rigo, Bingjian Huang, Jiayi Shen, Zhengtong Xu, Nick Colonnese, Amirhossein H. Memar

机构 * Meta Reality Labs Research(Meta现实实验室) Idiap Research Institute(Idiap研究机构) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) University of Toronto(多伦多大学) Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Tube Diffusion Policy,通过结合扩散模型与管反馈控制,解决富接触操作中对不确定性和高频触觉反馈的快速反应需求,实验验证其在多种任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04525 2026-04-23 cs.LG math.PR stat.ML 87%

Demystifying MaskGIT Sampler and Beyond: Adaptive Order Selection in Masked Diffusion

解析MaskGIT采样器及其超越:在Masked Diffusion中的自适应顺序选择

Satoshi Hayakawa, Yuhta Takida, Masaaki Imaizumi, Hiromi Wakaki, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文分析了MaskGIT采样器的隐含温度采样机制,提出更易解释的moment采样器,并通过部分缓存技术和混合方法改进了选择-采样算法,验证了理论并提升了实际性能。

Comments 23 pages, fixed cleveref-related issue

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13481 2026-04-16 cs.LG cs.AI physics.ao-ph 87%

Monthly Diffusion v0.9: A Latent Diffusion Model for the First AI-MIP

每月扩散v0.9:一种用于首次AI-MIP的潜在扩散模型

Kyle J. C. Hall, Maria J. Molina

机构 * Department of Atmospheric & Oceanic Sciences(大气与海洋科学系)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Monthly Diffusion v0.9,采用受SFNO启发的CVAE架构,在低频大气内部变异性建模中利用潜在扩散,以每月均值时间步长在数据稀疏条件下进行前向步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16406 2025-03-21 cs.GR cs.CV cs.MM 87%

VerbDiff: Text-Only Diffusion Models with Enhanced Interaction Awareness

SeungJu Cha, Kwanyoung Lee, Ye-Chan Kim, Hyunwoo Oh, Dong-Jin Kim

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Accepted at CVPR 2025, code : https://github.com/SeungJuCha/VerbDiff.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00826 2025-02-04 cs.CL 87%

Weak Supervision Dynamic KL-Weighted Diffusion Models Guided by Large Language Models

Julian Perry, Frank Sanders, Carter Scott

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03400 2024-08-08 cs.CR cs.AI cs.LG 87%

Attacks and Defenses for Generative Diffusion Models: A Comprehensive Survey

Vu Tuan Truong, Luan Ba Dang, Long Bao Le

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08195 2025-03-21 cs.CV cs.AI cs.MM 87%

Image is All You Need to Empower Large-scale Diffusion Models for In-Domain Generation

Pu Cao, Feng Zhou, Lu Yang, Tianrui Huang, Qing Song

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV、cs.MM

Comments Accepted to CVPR2025. Code is available at https://github.com/PRIV-Creation/In-domain-Generation-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02779 2023-07-27 cs.CV cs.GR cs.LG 87%

Blended Latent Diffusion

Omri Avrahami, Ohad Fried, Dani Lischinski

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

Comments Accepted to SIGGRAPH 2023. Project page: https://omriavrahami.com/blended-latent-diffusion-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11655 2026-07-14 cs.CV 新提交 86%

Feature-Space Guided Diffusion for Realistic Ultrasound Image Synthesis

用于逼真超声图像合成的特征空间引导扩散

Marina Domínguez, Nélida Mirabet-Herranz, Valery Naranjo

机构 * Artikode Intelligence S.L.(Artikode智能有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对条件扩散模型合成超声图像逼真度不足问题,提出无需训练的特征空间候选引导(FSCG)采样策略,通过局部k近邻特征校正及按特征空间能量选最佳候选,缩小与真实图像差距,在多数据集上效果优于标准采样及其他基线。

Comments 11 pages, 4 figures. Pre-review manuscript version of a paper accepted at DGM4MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09787 2026-07-14 cs.CV cs.LG 新提交 86%

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

用于激光雷达距离图像合成的对抗引导扩散

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(雅典国立技术大学电气与计算机工程学院) Industrial Systems Institute, Athena Research Center(雅典娜研究中心工业系统研究所)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对二维距离图像分割的无限制对抗攻击,提出基于扩散并利用分割损失对抗引导的方法,在SemanticKITTI数据集实验,能跨架构转移,相比基线在有效性与现实性间有独特权衡,实现可控退化。

Comments Accepted at the 1st Workshop on Secure and Trustworthy AI (STAI 2026), co-located with the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交 86%

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title);分类 cs.CV

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22924 2026-06-23 cs.CV 新提交 86%

MythraGen: Two-Stage Retrieval Augmented Art Generation Framework

MythraGen:两阶段检索增强艺术生成框架

Quang-Khai Le, Cong-Long Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh city, Vietnam(胡志明市科学大学) Vietnam National University, Ho Chi Minh city, Vietnam(越南国家大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MythraGen框架,结合艺术检索与LoRA微调,通过检索与提示最相似的艺术图像微调Stable Diffusion,在WikiArt数据集上生成高质量、风格匹配的艺术作品。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20889 2026-06-23 cs.CV cs.AI cs.LG 版本更新 86%

Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

文本到图像扩散模型的测试时对齐:通过空文本嵌入优化

Taehoon Kim, Henry Gouk, Timothy Hospedales

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Samsung AI Center, Cambridge(三星人工智能中心)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 提出Null-TTA方法,通过优化无分类器引导中的无条件嵌入实现测试时对齐,避免奖励黑客问题,在保持语义一致性的同时达到最先进性能。

Journal ref Published at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏