arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3080 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2359 篇

2606.08775 2026-06-09 cs.RO cs.AI 新提交 78%

Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic Tasks

统一对象中心世界模型与扩散策略:多阶段机器人任务的分层框架

Raktim Gautam Goswami, Prashanth Krishnamurthy, Yann LeCun, Farshad Khorrami

机构 * Tandon School of Engineering, New York University(纽约大学坦登工程学院) Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所) AMI Labs(AMI实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出WorldDP分层框架,结合高层世界模型进行运行时子目标优化和低层扩散策略执行,利用对象中心表示解耦环境实体,实现多阶段机器人操作任务的有效规划与执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08743 2026-06-09 cs.RO 新提交 78%

Guided Discovery of New Behaviors using Diffusion Policies

使用扩散策略引导发现新行为

Dian Yu, Sebastian Sanokowski, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich(慕尼黑工业大学慕尼黑机器人与机器智能研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出结合Feynman-Kac校正器与引导势能的框架,从扩散策略中挖掘并优化罕见但可行的轨迹,再训练策略以系统发现多样化可执行行为。

Comments Preprint. Supplementary video: https://youtu.be/T7MUvMA67VM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08699 2026-06-09 math.NA cs.NA math.AP 新提交 78%

Simultaneous recovery of multiple parameters in nonlocal diffusion equations from internal measurements

非局部扩散方程中多个参数的同时恢复:基于内部测量

Kai Yu, Zhiyuan Li, Yikan Liu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对非局部扩散方程,利用解渐近行为、解析延拓、拉普拉斯变换和解析函数性质证明逆问题唯一性,并用Levenberg-Marquardt方法进行稳定数值重建。

Comments 18 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08685 2026-06-09 math.NA cs.NA 新提交 78%

ND-TNN: Tensor-Neural-Network Approximation for High-Dimensional Nonlocal Diffusion Models

ND-TNN:高维非局部扩散模型的张量神经网络逼近

Ziyue Cai, Zuoqiang Shi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于张量神经网络(TNN)的数值方法求解高维非局部扩散模型,利用TNN的张量积结构和高斯核的可分离性将高维积分降维,并给出Dirichlet和Neumann边界条件下的误差估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08657 2026-06-09 cs.RO cs.AI 新提交 78%

Latent Diffusion Policy: Shaping Latent Spaces for Diffusion-Based Robotic Manipulation

潜在扩散策略:为基于扩散的机器人操作塑造潜在空间

Zhexuan Zhou, Yichen Lai, Jinhao Zhang, Huizhe Li, Youmin Gong, Jie Mei

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出两阶段框架LDP,通过CVAE编码器吸收场景理解,在预浓缩的潜在空间中进行流匹配,简化学习并提升多臂协调任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08501 2026-06-09 cs.CL 新提交 78%

Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

重回正轨:在扩散大语言模型中对齐奖励与状态以进行推理

Yawen Shao, Jie Xiao, Kai Zhu, Yu Liu, Hongchen Luo, Xueyang Fu, Yang Cao, Wei Zhai, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室) Northeastern University(东北大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散大语言模型强化学习中过程奖励与状态轨迹的双重错位问题,提出PAPO框架,通过步骤感知过程奖励和熵引导历史重演实现对齐,在四个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08468 2026-06-09 stat.ME math.ST stat.ML stat.TH 新提交 78%

Nonparametric undirected graphical model selection using diffusion models

基于扩散模型的非参数无向图模型选择

Hyeok Kyu Kwon, Myeonggu Kang, Minwoo Chae, Wanjie Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种基于扩散模型的非参数方法用于无向图模型选择,证明了模型选择一致性,并通过模拟和实际数据分析验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08439 2026-06-09 eess.SY cs.SY 新提交 78%

RadioDiff-Inv2: Differentiable Diffusion Inversion under Location Drift from Sparse Noisy Measurements for Radio Map Estimation

RadioDiff-Inv2: 位置漂移下基于稀疏噪声测量的可微扩散反演用于无线电地图估计

Xiucheng Wang, Kailong Wang, Nan Cheng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对稀疏噪声测量中位置漂移导致逆问题严重病态的问题,提出可微扩散反演框架RadioDiff-Inv2,通过高斯重采样构建漂移感知测量算子并优化噪声码,在PSNR上比最佳基线提升4-14 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08438 2026-06-09 stat.ML cs.LG 新提交 78%

Improving Bayesian Optimization via Training-Aware Conditional Diffusion Models

通过训练感知的条件扩散模型改进贝叶斯优化

Yilin Zheng, Haowei Wang, Szu Hui Ng, Enlu Zhou

机构 * National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出利用条件扩散模型高效近似最优解分布,并开发贝叶斯优化固有的训练策略和基于扩散的模态搜索采集函数,理论保证次优性,实验优于标准基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08414 2026-06-09 cs.RO cs.AI 新提交 78%

PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipulation

PACT: 具身操作中扩散策略的自我演化物理安全对齐

Lingxuan Wu, Zijian Zhu, Lizhong Wang, Chengyang Ying, Huayu Chen, Xiao Yang, Fangming Liu, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, 100084, China(计算机科学与技术系,人工智能研究院,清华-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,100084,中国) Peng Cheng Laboratory, 518108, China(鹏城实验室,518108,中国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出PACT框架,通过自演化后训练将预训练扩散策略投影到约束可行区域,无需演示数据或任务奖励,在降低31.0%安全违规的同时提升30.7%任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08411 2026-06-09 cs.CL 新提交 78%

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

AsyncLane: 扩散语言模型解码中精炼与推进的解耦

Yingxuan Ren, Yuxuan Lou, Yong Liu, Pengcheng Fang, Ziming Wang, Pengfei Zhou, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Southampton(南安普顿大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08408 2026-06-09 cs.CL cs.AI 新提交 78%

TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Steering

TimpaTeks: 通过扩散语言模型引导实现自动原地文本序列修改

Ryandito Diandaru, Ikhlasul Akmal Hanif, Fadli Aulawi Al Ghiffari, Ahmed Elshabrawy, Alham Fikri Aji

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出TimpaTeks方法,将激活引导扩展到扩散语言模型,实现原地文本修改以改变概念,在情感和概念引导任务上降低困惑度并保持句子结构。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08357 2026-06-09 cs.CL 新提交 78%

Forward-Free Diffusion Language Models

无前向过程的扩散语言模型

Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出FReDA,一种无需人工设计前向过程的扩散语言模型,通过递归分布细化利用模型生成草稿作为隐式中间状态,在推理和编码任务上超越更大模型,并实现1.5-1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08334 2026-06-09 cond-mat.stat-mech 新提交 78%

Enhanced dumbbell diffusion in a periodic potential by the elevator effect

周期势中由电梯效应增强的哑铃扩散

B. A. Kiang, H. Schiessel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过分子动力学模拟,研究弹簧连接的双珠(哑铃)在一维周期势中的随机游走,发现当弹簧平衡距离与势周期不匹配且弹簧常数足够大时,扩散增强,类似于电梯效应。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07982 2026-06-09 cs.LG 新提交 78%

Overcoming the Limits of Finite Difference Method; Physics-Informed Neural Network for Noisy High-Dimensional Heat Diffusion

克服有限差分法的局限性:用于含噪高维热扩散的物理信息神经网络

Shreesh Bhattarai, Harish Chandra Bhandari

机构 * Kathmandu University(加德满都大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对高维含噪热扩散问题,提出物理信息神经网络(PINN)框架,在噪声和维度较高时显著优于有限差分法(FDM),实现精度与效率的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07835 2026-06-09 cs.LG 新提交 78%

Mitigating the Contractivity Trap in Diffusion ODEs via Stein Stabilization

通过Stein稳定化缓解扩散ODE中的收缩陷阱

Shigui Li, Delu Zeng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散模型确定性概率流ODE大步长推理中的收缩陷阱问题,提出SteinDiff框架,通过Stein导出的几何感知残差校正机制正则化求解器更新,无需参考样本即可提升生成质量。

Comments 32 pages, 12 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07356 2026-06-08 cs.SD cs.CL 新提交 78%

DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast

DirectAudioEdit: 基于扩散预测对比的无反演文本引导音频编辑

Zhengkun Ge, Xiaoqian Liu, Haoran Zhang, Yuan Ge, Junxiang Zhang, Zhengtao Yu, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Kunming University of Science and Technology(昆明理工大学) NiuTrans Research, Shenyang, China(新译研究)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种无需训练和反演的文本引导音频编辑方法DirectAudioEdit,通过扩散预测对比构建编辑路径,在音乐和事件基准上降低FAD和KL指标15%以上,编辑速度提升高达64.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07293 2026-06-08 cs.SD cs.LG 新提交 78%

TargetSEC: Plug-and-Play In-the-Wild Speech Emotion Conversion via Arousal-Conditioned Latent Style Diffusion

TargetSEC: 基于唤醒度条件潜在风格扩散的即插即用野外语音情感转换

Constantin Alexander Auga

机构 * Hasso Plattner Institute / University of Potsdam(霍普特尔研究所 / 波茨坦大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出TargetSEC,一种基于嵌入驱动的潜在扩散框架,通过连续情感条件生成情感风格嵌入,在紧凑潜在空间操作,实现高转换精度和语音质量。

Comments 5 pages, 2 figures, 2 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06618 2026-06-08 cs.RO cs.AI cs.LG 新提交 78%

ChronoForest: Closed-Loop Multi-Tree Diffusion Planning for Efficient Bridge Search and Route Composition

ChronoForest: 用于高效桥接搜索和路线组合的闭环多树扩散规划

Jungmin Seo, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对仅依赖短程离线轨迹进行长程路线规划的问题,提出ChronoForest系统,通过锚链树扩散规划器和在线多树协调器实现局部桥接搜索与全局路线重解,在OGBench和哈密顿路线组合基准上显著提升成功率和效率。

Comments 40 pages, 4 figures, 7 tables, 3 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06518 2026-06-08 cs.AI cs.LG 新提交 78%

DiBS: Diffusion-Informed Branch Selection

DiBS: 扩散模型引导的分支选择

Bo Liu, Yuan Xie, Yuan Gao, Xiaolong Luo, Peng Ye, Tao Chen, Fujun Han

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对数独求解中学习型求解器缺乏正确性保证而符号求解器存在长尾搜索的问题,提出扩散模型引导的分支选择方法DiBS,在保持符号求解器完备性的同时,利用扩散模型排序候选值,显著降低搜索成本。

Comments 12 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07195 2026-06-08 math.NA cs.NA 新提交 78%

Adjoint-based Perfusion Estimation from Dynamic Contrast-Enhanced Ultrasound: Advection-Diffusion and Two-Compartment Models

基于伴随的动态对比增强超声灌注估计:对流扩散与两室模型

Sophie Externbrink, Ahmed El Kaffas, Dimitre Hristov, Sebastian Götschel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过伴随方法估计肿瘤血流速度和灌注参数,比较了对流扩散模型与生理上更合理的两室模型,并利用Tikhonov正则化和连续伴随方程进行高效梯度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07165 2026-06-08 physics.geo-ph 新提交 78%

Implicit Structural Modeling via Generative Diffusion Frameworks

基于生成扩散框架的隐式结构建模

Yimin Dou, Xinming Wu, Zhixiang Guo, Hui Gao, Buyu Deng

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于扩散模型的隐式结构建模方法,通过仿真合成数据训练和条件注入,有效处理复杂断层系统,保持拓扑一致性和运动学合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01686 2026-08-04 cs.CV 新提交 77%

Generative AI and Foundation Models in Medical Image

医学影像中的生成式AI与基础模型

Masahiro Oda

机构 * Nagoya University(名古屋大学) Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);分类 cs.CV

AI总结 本文概述生成式AI相关的扩散模型、LLMs及基础模型,介绍其在医疗辅助中的应用,探讨基础模型的构建方法与医疗应用,并研究利用国家资源开发医疗辅助AI的路径。

Comments Review Article

Journal ref Radiological Physics and Technology, vol.18, pp.937-948, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22101 2026-07-27 cs.CV 新提交 77%

InnoText: A Unified Model for Visual Text Generation and Editing

InnoText:一种用于视觉文本生成和编辑的统一模型

Haowei Liu, Runze He, Jian Lu, Ao Ma, Run Ling, Ke Cao, Jiasong Feng, Wei Feng, Shuo Lu, Yexing Xu, Yun Wang, Jing Wang, Zhanjie Zhang

机构 * JD.com, Inc.(京东公司) University of Chinese Academy of Sciences(中国科学院大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Beijing University of Technology(北京工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对视觉文本生成和编辑的挑战,提出基于DiT的统一框架InnoText,通过引入字体大小感知调制模块等策略,构建双语数据集,实现了在单个模型中进行文本生成和编辑,提升了生成精度和编辑质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16294 2026-07-21 cs.CV cs.AI 新提交 77%

A${}^2$BM: Alignment-Aware Bridge Matching for Image-to-Image Translation

A²BM:用于图像到图像翻译的对齐感知桥接匹配

Aimi Okabayashi, Georges Le Bellier, Nicolas Audebert, Charlotte Pelletier, Thomas Corpetti, Nicolas Courty

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image editing(abstract);分类 cs.CV

AI总结 研究图像到图像翻译中弱对齐数据问题,提出A²BM方法利用图像对对齐,在训练中纳入对齐分数区分真实对应,推理时控制翻译保真度,实验验证该方法比基线表现优,为弱对齐数据的图像翻译提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05649 2026-07-08 cs.CV cs.LG 新提交 77%

REVIVE: A Multi-Modal Framework for Vandalism Detection and Recovery in Autonomous Vehicles

REVIVE:一种用于自动驾驶车辆中破坏行为检测与恢复的多模态框架

Abdullah Tariq Choudhry, Tapadhir Das

机构 * University of the Pacific(太平洋大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);inpainting(abstract);分类 cs.CV

AI总结 研究自动驾驶车辆中破坏行为导致的遮挡攻击问题,提出REVIVE多模态框架,集成多种检测与恢复方法,如二进制VOA检测、多类VOA模式识别等,实验表明该框架能有效恢复图像,提升目标检测指标,提供结构化恢复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02628 2026-07-07 cs.CV cs.LG 新提交 77%

SE-UNet: Singular Equivariant Imaging for Real-World Constrained Generation

SE-UNet:用于现实世界约束生成的奇异等变成像

Kanishk Awadhiya

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 介绍SE-UNet框架,将生成视为受几何等变性和奇异值门控约束的优化问题,有效规范解空间,实现CIFAR-10上零样本修复,超越DIP基线,为约束生成提供数据高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23267 2026-06-23 cs.CV cs.CY 新提交 77%

Safe Few-Step Generation via Velocity Editing

通过速度编辑实现安全少步生成

Yujin Choi, Jaehong Yoon

机构 * NTU Singapore(新加坡南洋理工大学) UNIST(蔚山科学技术院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 针对流匹配文本到图像生成中少采样步数下的安全问题,提出无训练的速度编辑方法VESFlow及其增强版VESFlow+,通过编辑速度场而非修改提示词来引导生成远离不安全内容,在保持良性提示保真度的同时显著降低攻击成功率。

Comments Project Page: https://uzn36.github.io/VESFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21736 2026-06-23 cs.CV 新提交 77%

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

对抗域提示调优与生成用于单域泛化

Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出渐进式对抗提示调优框架,利用预训练扩散模型生成多样域风格图像,实现单域泛化,性能超越现有方法。

Comments 12 pages, 6 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11155 2026-06-10 cs.CV 新提交 77%

Mean Flow Distillation: Robust and Stable Distillation for Flow Matching Models

平均流蒸馏:面向流匹配模型的鲁棒稳定蒸馏方法

An Zhao, Shengyuan Zhang, Zhongjian Sun, Yixiang Zhou, Zejian Li, Ling Yang, Tianrun Chen, Lingyun Sun

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出平均流蒸馏(MFD)框架,通过时间低通滤波抑制优化噪声并保证轨迹一致性,实现流匹配模型的高保真单步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏