arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-14 至 2026-05-14 共收录 91 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 21 篇

2605.13321 2026-05-14 cs.RO 79%

HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation

HCSG:以人类为中心的语义-几何推理用于视觉-语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Jin Wu, Huashuo Lei, Yunfan Lou, Lujia Wang, Hesheng Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) University of Science and Technology Beijing(北京科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 HCSG提出了一种以人类为中心的框架,通过结合几何预测和语义解释,提升动态环境中视觉-语言导航的安全性和社交智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13266 2026-05-14 cs.RO 79%

Galilean State Estimation for Inertial Navigation Systems with Unknown Time Delay

伽利略导航系统中未知时间延迟的状态估计

Giulio Delama, Martin Scheiber, Yixiao Ge, Tarek Hamel, Stephan Weiss, Robert Mahony

机构 * Control of Networked Systems Group(网络化系统控制组) University of Klagenfurt(克莱根furt大学) Systems Theory and Robotics Group(系统理论与机器人组) Australian National University(澳大利亚国立大学) I3S, CNRS, Université Côte d’Azur and Institut Universitaire de France(I3S、CNRS、坎特伯雷大学及法国大学研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种基于伽利略对称性的几何框架,用于建模带有时间延迟的惯性导航系统,通过等变滤波器联合估计导航状态和时间延迟,验证结果显示其在保持精度和一致性方面优于现有EKF方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22117 2026-05-14 eess.SY cs.SY 79%

Safe Multi-Agent Navigation via Constrained HJB-Informed Learning

通过约束HJB引导学习实现安全多智能体导航

Fenglan Wang, Xinguo Shu, Lei He, Lin Zhao

专题命中 具身导航 :navigation(title,abstract);robotics(comments)

AI总结 本文提出HJB-GNN框架,通过联合学习控制屏障函数、分布式导航策略和价值函数,实现多智能体导航中的安全约束与目标达成的平衡,验证了其在复杂环境中的优越性能和可扩展性。

Comments Accepted by Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.09114 2026-05-14 cs.RO 70%

INSANE: Cross-Domain UAV Data Sets with Increased Number of Sensors for developing Advanced and Novel Estimators

INSANE:具有增加传感器数量的跨域无人机数据集,用于开发先进和新颖的估计器

Christian Brommer, Alessandro Fornasier, Martin Scheiber, Jeff Delaune, Roland Brockers, Jan Steinbrener, Stephan Weiss

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出INSANE数据集,通过多种场景和难度阶段提升无人机跨环境定位的鲁棒性,包含多种传感器数据及高精度地面真实信息,支持新型定位算法研究。

Comments V2 with added dataset comparison tables

Journal ref Int. J. Robot. Res. 43 (2024) 1083-1113

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13315 2026-05-14 cs.ET cs.LG cs.NE cs.SY eess.SY q-bio.NC 70%

Embodied Neurocomputation: A Framework for Interfacing Biological Neural Cultures with Scaled Task-Driven Validation

具身体神经计算:一种将生物神经文化与缩放任务驱动验证相接合的框架

Johnson Zhou, Daniel Tanneberg, Forough Habibollahi, Alon Loeffler, Kiaran Lawson, Valentina Baccetti, Kwaku Dad Abu-Bonsrah, Candice Desouza, Finn Doensen, Bradley Watmuff, Daria Kornienko, Azin Azadi, Justin Leigh Bourke, Bernhard Sendhoff, Brett J. Kagan

机构 * Cortical Labs, Australia Honda Research Institute Europe, Germany

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出具身体神经计算框架,通过大规模参数优化生物神经网络在模拟网格世界中闭环导航的编码解码机制,发现12种配置在任务表现上优于优化的硅基DQN代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12674 2026-05-14 cs.AI cs.LG cs.RO 67%

Revealing Interpretable Failure Modes of VLMs

揭示视觉语言模型的可解释性故障模式

Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva, Sayan Ranu, Gagandeep Singh

机构 * UIUC(伊利诺伊大学香槟分校) Kumo AI IIT Delhi(德里印度理工学院)

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出REVELIO框架,通过系统性探索揭示VLMs在自动驾驶和室内机器人领域中的可解释性故障模式,发现模型在空间定位和安全威胁识别上的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13741 2026-05-14 cs.RO cs.CV 62%

LEXI-SG: Monocular 3D Scene Graph Mapping with Room-Guided Feed-Forward Reconstruction

LEXI-SG:基于房间引导前馈重建的单目3D场景图映射

Christina Kassab, Hyeonjae Gil, Matías Mattamala, Ayoung Kim, Maurice Fallon

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 LEXI-SG是首个仅使用RGB相机输入的开放词汇3D场景图密集映射系统,通过语义先验分割场景为房间,实现可扩展的密集映射。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13442 2026-05-14 cs.RO 61%

Asymptotically Optimal Ergodic Coverage on Generalized Motion Fields

广义运动场上的渐近最优遍历覆盖

Christian Hughes, Yilang Liu, Yanis Lahrach, Julia Engdahl, Houston Warren, Darrick Lee, Fabio Ramos, Travis Miles, Ian Abraham

机构 * Yale University(耶鲁大学) Rutgers University(罗格斯大学) University of Edinburgh(爱丁堡大学) University of Sydney(悉尼大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出将自适应搜索建模为遍历覆盖问题,通过考虑领域演变,在动态环境中保证覆盖并实现有效探索,实验验证了方法在海洋探索及生物运动跟踪中的有效性。

Comments 13 pages, 9 figures, 6 tables, Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13665 2026-05-14 cs.RO 57%

Robot Squid Game: Quadrupedal Locomotion for Traversing Narrow Tunnels

机器人章鱼游戏:四足机器人在狭窄隧道中的移动

Amir Hossain Raj, Dibyendu Das, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种结合环境生成与策略蒸馏的强化学习框架,使四足机器人能稳健地在各种隧道配置中移动,克服传统方法在复杂地形适应性差的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13500 2026-05-14 cs.RO cs.CR 57%

Uncertainty-Aware 3D Position Refinement for Multi-UAV Systems

面向多无人机系统的不确定性感知3D位置细化

Hosam Alamleh, Damir Pulatov

机构 * University of North Carolina Wilmington(北卡罗来纳大学 Wilmington 分校)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种去中心化轻量3D位置细化层,通过融合各无人机的局部估计与邻居共享状态摘要及无人机间距离约束,提升鲁棒性,减少冷启动时的定位误差,且在恶意节点增多时表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13170 2026-05-14 cs.LG cs.MA 57%

Finding the Weakest Link: Adversarial Attack against Multi-Agent Communications

寻找最薄弱的环节:针对多智能体通信的对抗攻击

Maxwell Standen, Junae Kim, Claudia Szabo

机构 * The University of Adelaide(阿德莱德大学)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 本文研究了针对多智能体强化学习系统的一种单目标通信扰动攻击,提出利用雅可比矩阵的梯度信息来识别最易受攻击的消息、智能体和时间步,同时引入两种对抗损失函数以平衡攻击成功率与影响,通过实验验证了方法的有效性。

Comments Full version of the Extended Abstract presented at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13063 2026-05-14 cs.LG 57%

Ergodic Trajectory Design by Learned Pushforward Maps: Provable Coverage via Conditional Flow Matching

通过学习的推前映射进行遍历轨迹设计:通过条件流匹配实现可证明的覆盖

Ehsan Aghazadeh, Masoud Malekzadeh, Ahmad Ghasemi, Hossein Pishro-Nik

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 具身导航 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种epushforward框架,通过条件流匹配学习映射,将潜在轨迹分布转换为目标密度,实现轨迹的可证明覆盖,同时支持多智能体和不同约束条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12897 2026-05-14 cs.RO 57%

DynoJEPP: Joint Estimation, Prediction and Planning in Dynamic Environments

DynoJEPP:动态环境中的联合估计、预测与规划

Mikolaj Kliniewski, Jesse Morris, Yiduo Wang, Ian R. Manchester, Viorela Ila

机构 * Australian Centre For Robotics (ACFR)(澳大利亚机器人中心) School of Aerospace, Mechanical and Mechatronic Engineering (AMME)(航空航天、机械与机电工程学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 DynoJEPP通过引入定向因子解决传统因子图方法中预测与规划对状态估计的干扰问题,确保在动态环境中安全运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12735 2026-05-14 cs.RO 57%

The Unified Autonomy Stack: Toward a Blueprint for Generalizable Robot Autonomy

统一自主栈:迈向通用机器人自主性的蓝图

Mihir Dharmadhikari, Nikhil Khedekar, Mihir Kulkarni, Morten Nissov, Martin Jacquet, Angelos Zacharia, Marvin Harms, Albert Gassol Puigjaner, Philipp Weiss, Kostas Alexis

机构 * Autonomous Robots Lab(自主机器人实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出统一自主栈,通过多模态感知、多行为规划和多层安全导航模块实现通用机器人自主性,经实地测试验证其在复杂环境中的鲁棒性。

Comments 35 pages, 22 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05875 2026-05-14 cs.RO physics.flu-dyn 57%

Cycle-resolved Cephalopod-Inspired Pulsed-Jet Robot With High-Volume Expulsion and Drag-Reduced Gliding

基于循环分析的章鱼启发式脉冲喷射机器人:高体积排放与减阻滑翔

Yiyuan Zhang, Anye Zhong, Junkai Chen, Wenci Xin

机构 * Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(机械工程系,设计与工程学院,新加坡国立大学) Advanced Robotics Centre, National University of Singapore(先进机器人中心,新加坡国立大学) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联合研究技术中心)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种受章鱼启发的脉冲喷射机器人,通过刚柔混合折纸外壳实现大体积主动驱动变形,实验显示其在第一喷射周期内达到0.5m/s峰值速度,展示了高排放比收缩、减阻滑翔和被动进气阀对推进性能的影响。

Comments Updated author list; no changes to the scientific content

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17895 2026-05-14 cs.RO 57%

Locomotion of an Elastic Snake Robot via Natural Dynamics

通过自然动力学实现弹性蛇形机器人的运动

Tristan Ehlert, Arne Sachtler, Annika Schmidt, Davide Calzolari, Alin Albu-Schäffer

机构 * German Aerospace Center (DLR), Robotics and Mechatronics Center (RMC)(德国航空航天中心(DLR)机器人与机电中心) Technical University of Munich (TUM), Department of Computer Engineering(慕尼黑技术大学(TUM)计算机工程系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文研究了利用非线性自然动力学设计高效步态的方法,比较了两种基于自然动力学的步态与现有方法,发现非制动周期轨迹步态在能量节约情况下更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 10 篇

2512.08411 2026-05-14 cs.AI cs.RO 89%

Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems

棱柱世界模型:学习组合动力学以在混合系统中规划

Mingwei Li, Xiaoyuan Zhang, Chengwei Yang, Zilong Zheng, Yaodong Yang

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) NLCo Lab, Beijing Institute for General Artificial Intelligence(北大师范学院实验室,北京人工智能研究院)

专题命中 具身推理 :world model(title,summary_cn);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Prismatic World Model,通过分解混合动力学为可组合的原始构件,解决机器人领域中基于模型的规划问题,提升轨迹优化算法的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11193 2026-05-14 cs.RO cs.AI cs.CV 87%

Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy

多模态世界模型用于物理机器人交互:同时进行视觉和触觉预测以提高准确性

Willow Mandil, Amir Ghalamzan-E

机构 * University of Lincoln(林肯大学) University of Sheffield(谢菲尔德大学)

专题命中 具身推理 :world model(title,abstract);robotics(abstract,comments);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出多模态世界模型,通过整合视觉和触觉信息提升机器人物理交互的预测精度,特别是在物理模糊场景中表现更优。

Comments This paper is accepted for publication in Robotics and Autonomous Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13740 2026-05-14 cs.LG 79%

Learning POMDP World Models from Observations with Language-Model Priors

从观测中学习POMDP世界模型:利用语言模型先验

Valentin Six, Frederik Panse, Mathis Fajeau, Lancelot Da Costa, Mridul Sharma, Alfonso Amayuelas, Tim Z. Xiao, David Hyland, Philipp Hennig, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) IRIIS University of California, Santa Barbara(加州大学圣芭芭拉分校) University of Tübingen(图宾根大学) University of Oxford(牛津大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出Pinductor,利用语言模型先验从少量观测-动作轨迹学习POMDP模型,实现高效世界模型学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13013 2026-05-14 cs.LG 79%

JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning

JEDI: 联合嵌入扩散世界模型用于在线基于模型的强化学习

Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 JEDI通过联合嵌入扩散方法,构建了首个端到端的潜在扩散世界模型,提升了在线基于模型的强化学习效率与性能,减少了显存占用并加快了训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12620 2026-05-14 cs.AI 79%

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

再思一次,行动一次:验证引导的动作选择用于具身智能体

Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

机构 * Technical University of Darmstadt(达姆斯塔特技术大学)

专题命中 具身推理 :embodied agent(title,abstract);分类 cs.AI

AI总结 本文提出验证引导的动作选择框架,通过显式验证步骤提升基于MLLM的具身智能体的鲁棒性,实验证明在复杂任务中性能提升达36%。

Comments CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04506 2026-05-14 cs.CV cs.AI 73%

Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting

Ilov3Splat:基于高斯散射的实例级开放词汇3D场景理解

Binh Long Nguyen, Kien Nguyen, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

机构 * School of Electrical Engineering and Robotics(电气工程与机器人学学院) Queensland University of Technology(昆士兰理工大学) CSIRO Robotics(CSIRO机器人部) CSIRO

专题命中 具身推理 :robotics(abstract,abstract_cn);分类 cs.AI、cs.CV

AI总结 本文提出Ilov3Splat框架,通过增强高斯散射以实现实例级开放词汇3D场景理解,利用多分辨率哈希嵌入和对比损失提升语言语义关联与实例区分能力。

Comments The International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04759 2026-05-14 cs.CL cs.AI cs.ET cs.LG 62%

Gyan: An Explainable Neuro-Symbolic Language Model

Gyan:一种可解释的神经符号语言模型

Venkat Srinivasan, Vishaal Jatav, Anushka Chandrababu, Geetika Sharma

机构 * Innospark Ventures & Gyan AI(Innospark Ventures及Gyan AI) Gyan AI Inc.(Gyan AI公司)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 Gyan基于非Transformer架构构建,克服了传统大语言模型的局限性,在多个数据集上取得SOTA表现,展示了可信任且可靠的使命关键任务模型潜力。

Comments also submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17104 2026-05-14 cs.DC cs.AI cs.LG 62%

TStore: Rethinking AI Model Hub with Tensor-Centric Compression

TStore: 以张量为中心的AI模型仓库重新思考

Tingfeng Lan, Zirui Wang, Yunjia Zheng, Zhaoyuan Su, Juncheng Yang, Yue Cheng

机构 * University of Virginia(弗吉尼亚大学) Harvard University(哈佛大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 TStore通过细粒度去重和压缩技术减少存储开销,保留模型可用性和性能,实现实验中显著的存储节省。

Comments 12 pages, 6 figures. Systems paper on AI model storage

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12835 2026-05-14 cs.AI 57%

PROMETHEUS: Automating Deep Causal Research Integrating Text, Data and Models

PROMETHEUS:整合文本、数据和模型的深度因果研究自动化

Sridhar Mahadevan

机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08944 2026-05-14 cs.LG cs.MA 57%

Multi-Agent Decision-Focused Learning via Value-Aware Sequential Communication

多智能体决策导向学习 via 值感知序列通信

Benjamin Amoh, Geoffrey Parker, Wesley Marrero

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯大学泰勒工程学院)

专题命中 具身推理 :world model(abstract);分类 cs.LG

AI总结 本文提出SeqComm-DFL方法,通过值感知序列通信与决策导向学习结合,提升多智能体任务性能。方法引入序列Stackelberg条件生成消息,利用信息论界限证明收敛性,并在协作医疗和StarCraft多智能体挑战中取得显著奖励和胜率提升。

Comments 9 pages, 2 figues, 1 table, neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 7 篇

2605.13119 2026-05-14 cs.RO cs.AI cs.CV 78%

Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models

面向长周期具身智能体的工具对齐视觉-语言-动作模型

Zixing Lei, Changxing Liu, Yichen Xiong, Minhao Xiong, Yuanzhuo Ding, Zhipeng Zhang, Weixin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院) Beihang University(北京航空航天大学)

专题命中 机器人基础模型 :embodied agent(title);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出VLAs-as-Tools方法,通过高阶视觉语言模型与专用工具协作,提升长周期任务的成功率与调用忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10426 2026-05-14 cs.CV cs.AI 76%

CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving

CoWorld-VLA:面向自动驾驶的多专家世界模型中的思考

Minqing Huang, Yujiao Xiang, Zihan Liang, Jiajie Huang, Jingqi Wang, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang, Gong Che

机构 * Afari Intelligent Drive(Afari智能驾驶公司) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学)

专题命中 机器人基础模型 :world model(title);分类 cs.AI、cs.CV

AI总结 本文提出CoWorld-VLA,通过多专家世界推理框架,利用显式条件指导动作规划,提升自动驾驶的场景生成与路径规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13403 2026-05-14 cs.RO cs.CV 73%

RotVLA: Rotational Latent Action for Vision-Language-Action Model

RotVLA: 旋转的潜在动作用于视觉-语言-动作模型

Qiwei Li, Xicheng Gong, Xinghang Li, Peiyan Li, Quanyun Zhou, Hangjun Ye, Jiahuan Zhou, Yadong Mu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Xiaomi Robotics(小米机器人) CASIA

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 RotVLA提出基于连续旋转潜在动作表示的VLA框架,通过三元组帧学习和流匹配头实现高效动作建模,实现98.2%的LIBERO和89.6%/88.5%的RoboTwin2.0性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13382 2026-05-14 cs.RO 70%

BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning

BlockVLA: 通过块扩散微调加速自回归VLA

Ruiheng Wang, Shuanghao Bai, Haoran Zhang, Badong Chen, Xiangyu Xu

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出BlockVLA框架,通过块扩散方法将预训练自回归模型转化为高效离散扩散策略,减少推理延迟并提升训练效率,实验证明在复杂长周期任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏