arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86761 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70196 篇

2606.16700 2026-06-16 cs.CL 新提交 82%

Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models

多轮反射掩码激发掩码扩散模型中的推理能力

Yanming Zhang, Yihan Bian, Jingyuan Qi, Yuguang Yao, Lifu Huang, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Virginia Tech(弗吉尼亚理工大学) Intuit UC Davis(加州大学戴维斯分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract)

AI总结 提出反射掩码(RM)方法,通过轻量级后训练使掩码扩散模型具备多轮掩码与去噪能力,实现迭代局部修正,无需架构改变,在文本生成、数独和图像编辑等任务中优于基线。

Comments 22 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15154 2026-06-16 cs.RO 新提交 82%

Task-Aware Environment Augmentation for Reliable Navigation via Shielded Conditional Diffusion

任务感知的环境增强:通过屏蔽条件扩散实现可靠导航

Bharawee Phoompho, Gokul Puthumanaillam, Yan Miao, Ruben Hernandez, Tim Bretl, Sayan Mitra, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对部分可观测环境下的轨迹规划可靠性问题,提出任务感知的环境增强方法SCoDA,利用条件扩散模型学习最优视觉标记布局,通过屏蔽采样引导标记放置,提升轨迹执行可靠性和完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15023 2026-06-16 physics.flu-dyn cs.LG 新提交 82%

Multiscale Hypersonic Boundary Layer Reconstruction via Spectral Binning and Subdomain-wise Conditional Diffusion

基于频谱分箱和子域条件扩散的高超声速边界层多尺度重构

Hojin Kim, Dibyajyoti Chakraborty, Takahiko Toki, Carlo Scalo, Romit Maulik

机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Mathematics and Computer Science Division, Argonne National Laboratory(阿贡国家实验室数学与计算机科学部)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 提出多尺度概率重构框架,通过条件扩散模型从顶部壁面有限观测推断近壁状态,采用软重叠修复策略和边界频谱损失实现高超声速库埃特流全场重构。

Comments 33 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03212 2026-06-16 cs.LG 版本更新 82%

Bayesian Tensor Decomposition with Diffusion Model Prior

贝叶斯张量分解与扩散模型先验

Zerui Tao, Qibin Zhao

机构 * Zerui Tao(泽瑞·陶) Qibin Zhao(赵启斌)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 提出DiffBCP框架,结合累积收缩过程先验和预训练扩散模型,通过分裂吉布斯采样实现贝叶斯CP分解,在图像修复和去噪任务中优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13347 2026-06-12 cs.LG 新提交 82%

Enhanced Low-Density Region Exploration in Classifier-Guided Diffusion Models Through Modified Reverse Diffusion Sampling

改进反向扩散采样在分类器引导扩散模型中的低密度区域探索

Jagriti Singh, Shekhar Verma, Muneendra Ojha

机构 * University of Allahabad(阿拔斯大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 提出一种无需额外训练的采样时间密度感知方法,通过修改分类器梯度引导轨迹朝向低置信区域并引导采样朝向预测真实图像,以增强扩散模型对低密度区域的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18291 2026-06-11 cs.AI 版本更新 82%

Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies

扩散以协调:高效在线多智能体扩散策略

Zhuoran Li, Hai Zhong, Xun Wang, Qingxin Xia, Lihua Zhang, Longbo Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出首个在线离线策略多智能体强化学习框架OMAD,利用扩散策略和松弛策略目标最大化缩放联合熵,实现高效探索与协调,在MPE和MAMuJoCo上样本效率提升2.5至5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10390 2026-06-10 physics.med-ph 新提交 82%

Foveated-Imaging Geometry CT Architecture and Seeded Diffusion Model Enabling Global Super-Resolution Reconstruction

中心凹成像几何CT架构与种子扩散模型实现全局超分辨率重建

Wenxin Mo, Yingxian Xia, Yongle Yan, Hao Zhou, Li Zhang, Hewei Gao

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出中心凹成像几何CT架构,集成局部高分辨率数据到低分辨率主导的采集方案,并开发扩散概率超分辨率重建框架,实现全场高分辨率CT图像重建。

Comments 24pages,10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26985 2026-06-09 cs.LG cs.AI 版本更新 82%

Simple Self-Conditioning Adaptation for Masked Diffusion Models

简单自条件适应用于掩码扩散模型

Michael Cardei, Huu Binh Ta, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 本文提出一种简单有效的后训练适应方法,通过自条件预测提升掩码扩散模型的生成能力,减少生成困惑度并提升图像合成和分子生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21338 2026-06-05 cs.LG 82%

Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models

掩码可能具有干扰性:关于扩散语言模型中的上下文理解

Julianna Piskorz, Cristina Pinneri, Alvaro Correia, Motasem Alfarra, Risheek Garrepalli, Christos Louizos

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了扩散语言模型中掩码对上下文理解的影响,发现掩码会干扰模型对相关信息的处理,提出一种掩码无关的损失函数以提高模型的鲁棒性。

Comments Published at the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05113 2026-06-04 eess.IV 82%

3D-GlioPREDICT: 3D Latent Diffusion for Post-Radiotherapy Brain MRI Prediction in Patients with Glioma

3D-GlioPREDICT: 用于胶质瘤患者放疗后脑MRI预测的3D潜在扩散模型

Nordin Belkacemi, Selena Huisman, Vera C. Keil, Joost J. C. Verhoeff, Szabolcs David

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出一种3D潜在扩散框架,以空间分辨的体素级剂量分布为条件,结合预处理图像和随访时间,生成放疗后脑MRI,在公开数据集上优于2D方法。

Comments 12 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25050 2026-06-04 cs.RO 82%

DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors

DiscreteRTC:离散扩散策略是自然的异步执行器

Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang

机构 * UC Berkeley(加州大学伯克利分校) UIUC(伊利诺伊大学香槟分校) UT Austin(德克萨斯大学奥斯汀分校) UCLA(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 针对同步执行器在动态任务中的致命停顿问题,提出DiscreteRTC方法,利用离散扩散策略的原生修复能力实现异步执行,在动态模拟和真实操作任务中取得更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01865 2026-06-02 cs.RO 82%

Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections

集合监督扩散策略:通过修正学习动作分块扩散

Zhaoting Li, Gang Chen, Javier Alonso-Mora, Cosimo Della Santina, Jens Kober

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出集合监督扩散策略(SDP),利用人类修正中的对比动作分块数据,通过构建期望动作分块集合来训练扩散策略,有效缓解分布偏移并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01658 2026-06-02 cs.CR 82%

CoreUnlearn: Rethinking Concept Unlearning through Disentangled Component-Level Erasure in Text-guided Diffusion Models

CoreUnlearn: 通过解耦组件级擦除重新思考文本引导扩散模型中的概念遗忘

Mengnan Zhao, Lihe Zhang, Baocai Yin

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 提出CoreUnlearn方法,通过组件提取模块和交换解耦策略,在文本引导扩散模型中解耦并移除目标概念的关键组件,实现有效概念遗忘且最小化模型性能影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09651 2026-06-02 stat.ML cs.LG 82%

The Entropic Signature of Class Speciation in Diffusion Models

扩散模型中类别分化的熵特征

Florian Handke, Dejan Stančević, Felix Koulischer, Thomas Demeester, Luca Ambrogioni

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过追踪潜在语义变量的类别条件熵,检测扩散模型中的语义转变区间,并验证其在高斯混合模型和实际模型中的有效性。

Comments Accepted at International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03211 2026-06-02 cs.LG cs.AI 82%

Lookahead Sample Reward Guidance for Test-Time Scaling of Diffusion Models

前瞻样本奖励引导用于扩散模型的测试时缩放

Yeongmin Kim, Donghyeok Shin, Byeonghu Na, Minsang Park, Richard Lee Kim, Il-Chul Moon

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种高效测试时缩放方法LiDAR采样,通过前瞻几步采样和精确求解器引导粒子向高奖励区域移动,无需反向传播,在GenEval上达到与最新梯度引导方法相同性能且加速9.5倍。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22651 2026-06-02 cs.LG cs.AI 82%

GUDA: Counterfactual Group-wise Training Data Attribution for Diffusion Models via Unlearning

GUDA: 基于反事实的扩散模型分组训练数据归因方法

Naoki Murata, Yuhta Takida, Chieh-Hsin Lai, Toshimitsu Uesaka, Bac Nguyen, Stefano Ermon, Yuki Mitsufuji

机构 * University of Tokyo(东京大学) Toyota Central Research Laboratory(丰田中央研究所) University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出GUDA方法,利用机器遗忘近似反事实模型,通过似然评分规则(ELBO)量化组别影响,实现高效的分组训练数据归因。

Comments Accepted at ICML 2026. Code is available at https://github.com/sony/guda

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10339 2026-06-02 cs.AI 82%

On the Collapse of Generative Paths: A Criterion and Correction for Diffusion Steering

生成路径的崩溃:扩散引导的准则与修正

Ziseok Lee, Minyeong Hwang, Wooyeol Lee, Sanghyun Jo, Jihyung Ko, Young Bin Park, Jae-Mun Choi, Eunho Yang, Kyungsu Kim

机构 * Department of Biomedical Sciences, Seoul National University, Seoul, South Korea(首尔国立大学生物医学科学系) School of Transdisciplinary Innovations, Seoul National University, Seoul, South Korea(首尔国立大学跨学科创新学院) Interdisciplinary Program in AI, Seoul National University, Seoul, South Korea(首尔国立大学人工智能交叉学科项目) Kim Jaechul Graduate School of AI, Seoul, South Korea(金 Jaechul人工智能研究生院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 针对扩散和流模型推理时引导中出现的边缘路径崩溃问题,提出路径存在准则和自适应路径修正方法ACE,通过时变指数控制中间分布的分位数半径,在药物设计和图像生成任务中优于固定指数基线。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01581 2026-06-01 cs.RO 82%

Hyper-DP3: Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control

Hyper-DP3: 面向视觉运动控制的3D扩散策略的频率感知规模调整

Jinhao Zhang, Zhexuan Zhou, Huizhe Li, Yichen Lai, Wenlong Xia, Haoming Song, Youmin Gong, Jie Mei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 针对机器人操作中扩散策略的高计算成本问题,从频域角度分析动作轨迹的平滑性,提出轻量级3D扩散策略Hyper-DP3,使用扩散混合器解码器和两步DDIM推理,以极低参数和延迟实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27975 2026-05-29 cs.LG stat.ML 82%

Continual Learning in Modern Hopfield Networks with an Application to Diffusion Models

现代Hopfield网络中的持续学习及其在扩散模型中的应用

Ken Takeda, Masafumi Oizumi, Ryo Karakida

机构 * Graduate School of Arts and Science, The University of Tokyo(东京大学艺术与科学研究生院) Artificial Intelligence Research Center, AIST(AIST人工智能研究中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过现代Hopfield能量分析扩散模型中的持续学习,证明高能量异常样本更容易被遗忘,并基于能量选择重放样本以缓解遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26582 2026-05-27 cs.LG cs.AI 82%

On the Error-Correcting Effects of Stochasticity in Discrete Diffusion

离散扩散中随机性的纠错效应

William Yuan, Sungwon Jeong, Amirali Aghazadeh

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文系统研究离散扩散模型中马尔可夫转移随机性程度对采样效率与质量的权衡,提出离散搅动与重启采样(DCRS)算法,通过交替正向和反向扩散过程注入受控随机性,在低函数评估次数下改善速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07485 2026-05-26 astro-ph.GA 82%

A Guided Unconditional Diffusion Model to Synthesize and Inpaint Radio Galaxies from FIRST, MGCLS and Radio Zoo

一种引导无条件扩散模型,用于从FIRST、MGCLS和Radio Zoo合成和修复射电星系

Rémi Poitevineau, Emma Tolley, Verlon Etsebeth

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 提出一种掩码引导的扩散概率模型,用于生成和修复逼真的射电星系图像,以重建不完整观测并提升源表征和形态分类等下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01184 2026-05-26 cs.LG 82%

Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models

扩散与流模型中温度采样的时间分数重缩放

Yanbo Xu, Yu Wu, Sungjae Park, Zhizhuo Zhou, Shubham Tulsiani

机构 * School of Computer Science, Carnegie Mellon University, Pittsburgh, USA(计算机科学系,卡内基梅隆大学,匹兹堡,美国) Department of Computer Science, Stanford University, California, USA(计算机科学系,斯坦福大学,加利福尼亚,美国)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出一种无需微调或改变训练策略的方法,通过重缩放噪声数据的得分函数来调控扩散和流模型的采样多样性,实现局部温度控制,并在图像生成、姿态估计、深度预测、机器人操作和蛋白质设计等任务中验证了有效性。

Comments Accepted at ICML 2026. Project page: https://temporalscorerescaling.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23275 2026-05-25 cs.LG 82%

Diffusion Domain Expansion: Learning to Coordinate Pre-trained Diffusion Models

扩散域扩展:学习协调预训练扩散模型

Egor Lifar, Semyon Savkin, Timur Garipov, Shangyuan Tong, Tommi Jaakkola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出扩散域扩展(DDE)方法,通过紧凑可训练网络协调预训练扩散模型的去噪输出,以生成更大对象并处理更复杂条件,在长音频生成和条件图像生成中优于其他方法。

Comments Accepted as poster at ICML 2024 Workshop on Structured Probabilistic Inference and Generative Modeling (SPIGM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23226 2026-05-25 cs.AR 82%

MASQ: Accelerating Masked Diffusion via Stage-Wise Multi-Precision Quantization

MASQ: 通过阶段式多精度量化加速掩码扩散

Seeyeon Kim, Jaehun Lee, Sungyeob Yoo, Joo-Young Kim

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 针对掩码扩散中因全图处理导致的计算冗余问题,提出软硬件协同加速器MASQ,通过阶段式MXINT8/4/2精度分配、时间步感知调度及优化的非矩阵运算,实现高达16.06倍加速和4.18倍能效提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18176 2026-05-25 cs.CL 82%

Improving Sampling for Masked Diffusion Models via Information Gain

通过信息增益改进掩码扩散模型的采样

Kaisen Yang, Jayden Teoh, Kaicheng Yang, Yitong Zhang, Alex Lamb

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出一种无需训练的Info-Gain采样器,利用掩码扩散模型的双向结构平衡即时不确定性与剩余掩码位置的信息增益,在推理、编码、创意写作和图像生成任务中优于现有采样器。

Comments https://github.com/yks23/Information-Gain-Sampler Accepted by ICML2026 Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11246 2026-05-22 cs.LG 82%

Support-Proximity Augmented Diffusion Estimation for Offline Black-Box Optimization

支持接近增强的扩散估计用于离线黑盒优化

Yonghan Yang, Ye Yuan, Zipeng Sun, Linfeng Du, Bowei He, Haolun Wu, Can Chen, Xue Liu

机构 * MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩擦 bin Zayed 大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(Mila - 加拿大AI研究所) Amazon AGI(亚马逊人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SPADE框架,通过条件生成建模重新想象前向替代建模,利用扩散模型建模前向似然p(y|x),并引入校准扩散估计模块和支撑接近正则化机制,以提高优化性能。

Comments Accepted by ICML 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21911 2026-05-22 cs.LG 82%

Noise Schedule Design for Diffusion Models: An Optimal Control Perspective

扩散模型的噪声调度设计:一个最优控制视角

Seo Taek Kong, Weina Wang, R. Srikant

机构 * ECE & CSL University of Illinois Urbana-Champaign(电子工程与计算机科学实验室,伊利诺伊大学厄巴纳-香槟分校) Computer Science Department Carnegie Mellon University(计算机科学系,卡内基梅隆大学) ECE, CSL & NCSA University of Illinois Urbana-Champaign(电子工程、计算机科学实验室及国家计算科学中心,伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文从最优控制的角度出发,提出了一种分析和设计扩散模型噪声调度的框架,通过将噪声调度问题转化为最优控制问题,推导出噪声调度的充分条件,实现了更优的采样误差,并通过参数调整得到新的噪声调度方案,提升了图像生成的FID分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16077 2026-05-22 cs.LG 82%

MDM-Prime-v2: Binary Encoding and Index Shuffling Enable Scaling of Diffusion Language Models

MDM-Prime-v2:二进制编码和索引洗牌使扩散语言模型能够扩展

Chen-Hao Chao, Wei-Fang Sun, Junwei Quan, Chun-Yi Lee, Rahul G. Krishnan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA AI Technology Center(NVIDIA AI技术中心) National Taiwan University(国立台湾大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出MDM-Prime-v2,通过二进制编码和索引洗牌技术改进扩散语言模型,解决了子分词器功能形式与BPE分词器结合导致的交叉熵损失增加以及子分词器粒度超参数选择缺乏工具的问题,从而提升了模型在常识推理基准上的零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18159 2026-05-22 cs.LG 82%

Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models

为扩散模型带来稳定性:分解和减少训练掩码扩散模型的方差

Mengni Jia, Mengyu Zhou, Yihao Liu, Xiaoxi Jiang, Guanjun Jiang

机构 * University of Cambridge(剑桥大学) Peking University(北京大学) Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了掩码扩散模型(MDMs)训练方差高导致不稳定的问题,通过分解方差来源并提出六种方差减少方法,显著提升了模型在复杂推理任务中的准确率,并将运行间变异性降低至自回归模型(ARMs)水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20894 2026-05-21 cs.RO 82%

Mobile UMI: Cross-View Diffusion Policy with Decoupled Kinematics for Mobile Manipulation

Mobile UMI: 用于移动操作的跨视角扩散策略与解耦动力学

Haoran Huang, Haonan Dong, Huixu Dong

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种无需硬件的演示框架Mobile UMI,通过三个组件解决移动模仿学习中的两个瓶颈问题:运动污染的动作标签和推理导致的执行延迟。核心方法是通过双摄像头捕捉全局和局部上下文,结合空间锚点统一视觉-惯性框架,并利用异步递推地执行器进行在线状态匹配,从而实现解耦的动力学和基座轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏