arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9157 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9157 篇

2606.27295 2026-06-29 cs.RO 新提交 84%

LA4VLA: Learning to Act without Seeing via Language-Action Pretraining

LA4VLA:通过语言-动作预训练实现无视觉行动学习

Tao Lin, Yuxin Du, Yiran Mao, Zewei Ye, Yilei Zhong, Bing Cheng, Yiming Wang, Jiting Liu, Yang Tian, Junchi Yan, Feiran Wu, Zenan Meng, Hu Wei, Yuqian Fu, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) KAUST(阿卜杜拉国王科技大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出LA4VLA框架,通过语言-动作预训练学习动作先验,减少对视觉线索的依赖,提升VLA策略的鲁棒性,在仿真和真实任务中成功率显著提升。

Comments Github: https://github.com/MINT-SJTU/LA4VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27375 2026-06-26 cs.RO 新提交 84%

Scalable Behavior Cloning with Open Data, Training, and Evaluation

基于开放数据、训练和评估的可扩展行为克隆

Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出ABC开源行为克隆栈,包含最大遥操作数据集ABC-130K(3500小时/13万片段/195任务),并开源硬件、训练和仿真流程,通过协同训练实现仿真与真实评估关联,验证DiT和VLA模型设计,成功执行折纸盒、取信用卡等灵巧任务。

Comments 30 pages. Project page: https://abc.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22174 2026-06-23 cs.RO 新提交 84%

OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation

OpenHLM:全身人形机器人移动操作的经验配方

Yingdong Hu, Haodong Zhu, Boyuan Zheng, Yihang Hu, Tong Zhang, Zunhao Chen, Junming Zhao, Ruiqian Nai, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Spirit AI

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出OpenHLM,通过全身遥操作、VLA模型设计和异构协同训练三阶段实验,构建直接映射语言和像素到人形机器人全部自由度的原生视觉-语言-动作模型,在长时域任务中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16208 2026-06-16 cs.RO 新提交 84%

ATHENA: Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation

ATHENA: 加速的多任务异构影响函数用于机器人数据筛选

Tao Xu, Jiaxin Wang, Runhao Zhang, Jiayi Guan, Xianchao Zeng, Weixi Song, Xinyu Zhou, Zhetao Chen, Guang Chen, Yong-Lu Li

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Xi'an Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出ATHENA框架,利用Kronecker梯度结构和秩r随机截断近似加速影响函数计算,实现多任务VLA模型数据筛选,在模拟和真实机器人任务中以更少数据达到或超越全数据微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16207 2026-06-16 cs.RO 版本更新 84%

IVRA: Improving Visual-Token Relations for Robot Action Policy with Training-Free Hint-Based Guidance

IVRA: 通过无需训练的提示引导改善机器人动作策略的视觉-令牌关系

Jongwoo Park, Kanchana Ranasinghe, Jinhyeok Jang, Cristina Mata, Yoo Sung Jang, Michael S Ryoo

机构 * Stony Brook University(石溪大学) ETRI(电子技术研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出IVRA方法,利用模型内置视觉编码器的亲和力提示,无需额外编码器或重训练,在推理时调整视觉-令牌交互以增强空间理解,在多种VLA架构和任务上提升操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13279 2026-06-12 cs.RO 新提交 84%

See Selectively, Act Adaptively: Dual-Level Structural Decomposition for Bimanual Robot Manipulation

选择性观察,适应性行动:双水平结构分解用于双臂机器人操作

Yoon-Ji Choi, Young-Chae Son, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出基于双水平结构分解的双臂操作VLA框架,通过视觉选择路由和动作专家混合机制分别处理视觉相关性和双臂交互模式,在模拟和真实任务中成功率分别提升27.7%和43.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12956 2026-06-12 cs.RO 新提交 84%

SERF: Spatiotemporal Environment and Robot Feature Map for Long-Horizon Mobile Manipulation

SERF:面向长时域移动操作任务的时空环境与机器人特征地图

Sunghwan Kim, Byeonghyun Pak, Kehan Long, Yulun Tian, Nikolay Atanasov

机构 * UC San Diego(加州大学圣地亚哥分校) Agency for Defense Development(国防发展局) SceniX Inc.(SceniX公司) University of Michigan(密歇根大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出SERF地图,将环境与机器人身体表示为共享潜空间中的神经点,并在线更新,作为VLA模型的状态输入,提升长时域移动操作中的推理能力,在BEHAVIOR-1K上优于纯图像基线。

Comments Project page: https://existentialrobotics.org/serf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11221 2026-06-11 cs.CV 新提交 84%

LAST: Bridging Vision-Language and Action Manifolds via Gromov-Wasserstein Alignment

LAST: 通过Gromov-Wasserstein对齐连接视觉-语言与动作流形

Huaihai Lyu, Chaofan Chen, Yuheng Ji, Xiansheng Chen, Pengwei Wang, Shanghang Zhang, Changsheng Xu

机构 * National Engineering Laboratory for Intelligent Information Processing(智能信息处理国家级工程实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 提出LAST方法,通过李代数线性化和局部度量离散化,对齐视觉-语言语义几何与动作流形,解决异构空间不兼容问题,提升VLA模型收敛性和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10305 2026-06-10 cs.RO 新提交 84%

SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

SARM2: 多任务阶段感知奖励建模用于自我改进的机器人操作

Qianzhong Chen, Hau Zheng, Justin Yu, Suning Huang, Jiankai Sun, Ken Goldberg, Chuan Wen, Pieter Abbeel, Yide Shentu, Philipp Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出多任务阶段感知奖励模型RM,结合动作基元阶段估计器和多门控专家混合值头,为机器人操作任务提供密集逐步奖励,并基于RM构建SPIRAL框架,通过廉价自主轨迹改进VLA策略,在10任务基准上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05468 2026-06-05 cs.RO 84%

FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization

FlowPRO:通过近端偏好优化对流匹配VLA进行无奖励强化微调

Yihao Wu, He Zhang, Junbo Tan, Xueqian Wang, Zhengyou Zhang

机构 * Tencent Robotics X(腾讯机器人X实验室) Futian Laboratory(福田实验室) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出FlowPRO框架,通过近端偏好优化(RPRO)和干预-回滚数据收集方法,实现无奖励的离线强化微调,在四类长时程双臂任务中取得最高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03392 2026-06-03 cs.RO 84%

OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform

OpenEAI-Platform: 一个开源具身人工智能硬件-软件统一平台

Jinyuan Zhang, Luoyi Fan, Leiyu Wang, Yeqiang Wang, Yicheng Zhu, Cewu Lu, Nanyang Ye

机构 * Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出OpenEAI-Platform,集成低成本6+1自由度机械臂和可复现VLA模型,通过开源设计和两阶段训练在真实操作任务中超越商业臂,性能媲美大规模预训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01951 2026-06-02 cs.RO 84%

Co-training with Ego-centric Video and Demonstration for Robot Navigation Task

基于自我中心视频与示范的机器人导航任务协同训练

Shoya Kuno, Yumo Ouchi, Kanata Suzuki

机构 * Department of Informatics, Graduate School of Informatics, Kyoto University(信息学系,京都大学研究生院) Spatial Robotics Research Center, Fujitsu Limited(空间机器人研究中心,富士通有限公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出将自我中心行走视频转化为移动机器人模仿学习数据集的框架,通过联合训练VLA模型提升语言理解和动作生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30877 2026-06-02 cs.RO 84%

Wall-OSS-0.5 Technical Report

Wall-OSS-0.5 技术报告

Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出Wall-OSS-0.5,一个基于3B VLM骨干网络并增强动作生成组件的4B开源VLA模型,通过梯度桥接联合训练策略,在超过20个实体上预训练,实现零样本真实机器人行为,并在微调后超越π_0.5,证明VLA预训练本身即可产生可执行的机器人能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12369 2026-06-02 cs.RO 84%

GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization

GuidedVLA: 通过即插即用的动作注意力特化指定任务相关因素

Xiaosong Jia, Bowen Yang, Zuhao Ge, Xian Nie, Yuchen Zhou, Cunxin Fan, Yufeng Li, Yilin Chai, Chao Jing, Zijian Liang, Qingwen Bu, Haidong Cao, Chao Wu, Qifeng Li, Zhenjie Yang, Chenhe Zhang, Hongyang Li, Zuxuan Wu, Junchi Yan, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Shanghai Jiao Tong University(上海交通大学) OpenDriveLab, The University of Hong Kong(OpenDrive实验室,香港大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出GuidedVLA框架,通过为动作解码器中的注意力头分配人工定义的辅助信号(如物体定位、空间几何、时序技能逻辑),显式引导模型关注任务相关因素,提升VLA模型在域内和域外场景的成功率。

Comments Accepted to RSS 2026. Project page: https://guidedvla.github.io/project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30795 2026-06-01 cs.RO 84%

Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning

Feat2Go: 面向具身强化学习的视觉特征基础价值估计

Junyang Shu, Zhiwei Lin, Bingqing Wei, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University, China(北京大学计算机科学技术研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出Feat2Go框架,通过预训练视觉世界模型提取补丁级子目标相似度并聚类语义阶段,训练具身价值模型预测结构进度以重塑终端奖励,显著提升VLA模型在单臂和双臂操作任务中的强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10422 2026-06-01 cs.CV 84%

World2Act: Latent Action Post-Training from World Model Dynamics

World2Act:基于世界模型动力学的潜在动作后训练

An Dinh Vuong, Tuan Van Vo, Abdullah Sohail, Haoran Ding, Liang Ma, Xiaodan Liang, Anqing Duan, Ivan Laptev, Ian Reid

机构 * MBZUAI

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 提出World2Act框架,通过潜在空间对齐世界模型动力学与动作嵌入,避免像素级监督,在仿真和真实机器人上提升VLA策略的成功率。

Comments Updated version. Project page: https://wm2act.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21013 2026-06-01 cs.RO 84%

Notes-to-Self: Scratchpad Augmented VLAs for Memory Dependent Manipulation Tasks

笔记到自我:带草稿本的增强型VLA用于依赖记忆的操作任务

Sanjay Haresh, Daniel Dijkman, Apratim Bhattacharyya, Roland Memisevic

机构 * Qualcomm AI Research(高通AI研究)

专题命中 VLA模型 :VLA(title_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文通过在视觉-语言-动作模型中加入语言草稿本来赋予其空间和时间记忆,从而提升其在依赖记忆的长时域操作任务上的泛化能力。

Comments To appear at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12334 2026-05-21 cs.AI 84%

Reinforcing VLAs in Task-Agnostic World Models

在任务无关的世界模型中强化视觉-语言-动作

Yucen Wang, Rui Yu, Fengming Zhang, Junjie Lu, Xinyao Qin, Tianxiang Zhang, Kaixin Wang, Li Zhao

机构 * Microsoft Research Asia(微软亚洲研究院) Nanjing University(南京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学) University of Technology Sydney(悉尼科技大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.AI

AI总结 本文提出RAW-Dream方法,通过分离世界模型学习与下游任务依赖,利用预训练的世界模型和现成的视觉-语言模型,实现零样本推理,从而在无需任务特定数据的情况下提高VLA适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17915 2026-04-21 cs.CV 84%

OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models

OneDrive: 统一的多范式驾驶与视觉-语言-动作模型

Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA School of Artificial Intelligence, University of Chinese Academy of Sciences AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University Voyager Research, Didi Chuxing School of Information Science(多模态人工智能系统国家重点实验室,中国科学院自动化所人工智能学院,中国科学院大学,AutoLab,上海交通大学人工智能学院,Voyager Research,滴滴出行,信息科学与技术学院)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.CV

AI总结 本文提出基于预训练视觉语言模型的统一自动驾驶框架,通过单一Transformer解码器整合异构解码行为,实现多任务联合优化,实验表明在nuScenes和NAVSIM上取得最优性能,且推理效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22846 2026-04-01 cs.AI 84%

CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models

CoMaTrack: 基于竞争的多智能体博弈跟踪与视觉-语言-动作模型

Youzhi Liu, Li Gao, Liu Liu, Mingyang Lv, Yang Cai

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.AI

AI总结 本文提出CoMaTrack,一种基于竞争的多智能体强化学习框架,通过动态对抗环境训练,提升跟踪任务的适应性和鲁棒性,并引入首个开源的CoMaTrack-Bench基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06484 2025-08-21 cs.GR cs.CV 84%

3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds

Fan-Yun Sun, Shengguang Wu, Christian Jacobsen, Thomas Yim, Haoming Zou, Alex Zook, Shangru Li, Yu-Hsin Chou, Ethem Can, Xunlei Wu, Clemens Eppner, Valts Blukis, Jonathan Tremblay, Jiajun Wu, Stan Birchfield, Nick Haber

机构 * Stanford University(斯坦福大学) Nvidia Research(英伟达研究)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.CV

Comments project website: https://ai.stanford.edu/~sunfanyun/3d-generalist/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02166 2025-05-06 cs.RO 84%

CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation

Xiaoqi Li, Lingyun Xu, Mingxu Zhang, Jiaming Liu, Yan Shen, Iaroslav Ponomarenko, Jiahui Xu, Liang Heng, Siyuan Huang, Shanghang Zhang, Hao Dong

机构 * School of Computer Science, Peking University(北京大学计算机学院) PKU-Agibot Lab(北京大学AGIBOT实验室)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10860 2026-08-14 cs.RO cs.CV 版本更新 84%

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Flex-$π$:具备计算灵活性的多流世界-动作模型

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究提出Flex-$π$多流世界-动作模型,利用冻结的视频生成VAE实现多模态监督,通过混合专家Transformer与每流丢弃机制提升效率,在双臂操作任务上性能优于基线模型且运行更快。

Comments Project page: https://flex-pi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08839 2026-08-11 cs.RO cs.CV 新提交 84%

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

SG-WAM:面向世界-动作模型的文本 grounded 与空间感知语义引导

Junjie He, Junfeng Li, Zhide Zhong, Haodong Yan, Ruixin Li, Yangyang Zheng, Jiaguan Zhu, Tianran Zhang, Yuqiao Du, Wen Chen, Shunbo Zhou, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ola Dimensions(奥拉维度公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 针对现有世界-动作模型(WAM)存在的视频与指令语义不对齐问题,提出基于视觉-语言模型(VLM)的SG-WAM语义引导方法,通过注入文本接地且空间感知的语义前瞻,提升了WAM的指令遵循与操纵精度,经仿真和真实实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06994 2026-08-10 cs.RO cs.AI 新提交 84%

Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models

将意图与轨迹解耦:面向世界动作模型的表示演绎框架

Xiangkai Ma, Yue Ma, Junjie Wang, Sheng Xu, Mingyang Li, Han Zhang, Yuzheng Zhuang, Wenzhong Li, Zhihao Yuan

机构 * NJU(南京大学) HKUST(香港科技大学) CUHK-SZ(香港中文大学(深圳)) THU(清华大学) Joy Future Academy, JD(京东探索研究院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 针对现有世界动作模型的表示纠缠问题,提出PILOT的表示演绎框架,解耦运动语义与轨迹细节,提升复杂机器人操纵任务的性能与可解释性,兼具少样本微调及架构迁移的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05903 2026-08-10 cs.CV cs.RO 版本更新 84%

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北京航空航天大学) Huawei Foundation Model Department(华为基础模型部门)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28405 2026-07-31 cs.AI cs.LG 新提交 84%

QuantWAMs: Calibrating at the Right Granularity for World Action Models

QuantWAMs:为世界动作模型校准至合适粒度

Jiacheng Zhou, Jinfan Lv, Ruixuan Li, Longtai Zhang, Yan Wang, Wenqiang Zhang, Lizhe Qi

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantWAMs框架,通过三种校准策略优化后训练量化,在WAMs上实现内存大幅降低与速度提升,同时保持与FP16接近的性能,验证了部署可行性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24159 2026-07-28 cs.RO cs.CV 新提交 84%

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning

DeVA:用于机器人策略学习的具有物理引导的解耦视频-动作模型

Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 研究可泛化机器人操纵策略,提出DeVA模型,通过专门的视频和动作专家、多级特征转移及物理显著引导,实现丰富信息交换,使策略学习更易处理,在模拟和实际实验中展现良好性能。

Comments Project page with videos, code, and checkpoints: https://deva-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11689 2026-07-14 cs.RO cs.AI 新提交 84%

From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence

从世界行动模型到具身大脑:开放世界物理智能路线图

Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li

机构 * IEEE

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究针对通用人工智能中物理世界推理行动的进展零散问题,提出以具身大脑为中心的物理智能协同进化路线图,利用世界行动模型等,通过物理框架、共享契约和闭环训练等构建模块化智能栈,推动物理智能发展。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03142 2026-06-30 cs.RO cs.CV 84%

MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning

MM-Nav:基于多专家学习的多视角VLA模型用于鲁棒视觉导航

Tianyu Xu, Jiawei Chen, Jiazhao Zhang, Wenyao Zhang, Zekun Qi, Minghan Li, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MM-Nav模型,通过多专家学习从合成数据中学习多样化的导航能力,展示模型在合成环境中的强泛化能力,并在现实世界实验中验证其有效性。

Comments Project page: https://pku-epic.github.io/MM-Nav-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏