arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9146 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2607.14236 2026-07-17 cs.RO cs.AI cs.LG 新提交 89%

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection

力,永不嫌迟:通过反应式力注入加速视觉-语言-动作模型的训练后优化

Yi Wang, Wendi Chen, Zimo Wen, Han Xue, Xueqi Li, Wenye Yu, Zhijie Chen, Hao Yang, Jun Lv, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Noematrix Ltd.(诺玛矩阵有限公司)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究针对预训练VLA策略在接触状态下表现不佳的问题,提出LIFT框架,通过嫁接反应式动作专家、注入力及结合在线DAgger循环,提升其在富含接触操作任务中的性能,且证明相关组件对稳健操作很重要。

Comments Project page: https://lift-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11324 2026-07-14 cs.RO cs.AI cs.LG 版本更新 89%

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Embodied-R1.5:通过具身基础模型演化物理智能

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

机构 * Tianjin University(天津大学) Tencent Hunyuan(腾讯混元)

专题命中 VLA模型 :VLA(summary_cn,abstract);embodied foundation model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。

Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05116 2026-07-09 cs.CV cs.AI cs.RO 版本更新 89%

VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

VOTE:基于轨迹集成投票的视觉-语言-动作优化

Juyi Lin, Amir Taherin, Arash Akbari, Arman Akbari, Lei Lu, Guangyu Chen, Taskin Padir, Xiaomeng Yang, Weiwei Chen, Yiqian Li, Xue Lin, David Kaeli, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Cisco(思科) EmbodyX

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);vision language action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新 89%

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00666 2026-07-02 cs.RO cs.CV cs.LG 新提交 89%

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts

域算术:环境变化下的单次VLA适应

Taewook Kang, Taeheon Kim, Donghyun Shin, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出域算术(DART)方法,通过权重向量算术和子空间对齐,仅需单次演示即可适应环境变化,在视觉和实体变化场景下优于现有方法。

Comments ECCV 2026. Project page: https://twkang43.github.io/projects/dart

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12043 2026-06-17 astro-ph.HE 89%

Mapping the emission and spectral properties of the FRI radio galaxy 3C 449 with LOFAR and the VLA

用LOFAR和VLA测绘FRI射电星系3C 449的发射和光谱特性

Luca Ricci, Luisa Ostorero, Raffaella Morganti, Judith H. Croston, Martin J. Hardcastle, Timothy W. Shimwell

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 通过结合LOFAR和VLA数据,研究3C 449射电星系的射电发射和光谱特性,揭示其喷流和羽翼的演化过程及粒子加速机制。

Comments 26 pages, 37 figures, accepted for publication in A&A

Journal ref A&A 710, A214 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13733 2026-06-11 cs.LG cs.AI cs.RO 版本更新 89%

Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents

视觉-语言-动作跳跃启动用于强化学习机器人智能体

Angelo Moroncelli, Roberto Zanetti, Marco Maccarini, Loris Roveda

机构 * University of Applied Science and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) Università della Svizzera Italiana, Faculty of Informatics, Lugano, Switzerland(瑞士意大利大学信息学院,卢加诺,瑞士)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出VLAJS方法,通过稀疏的VLA高层动作建议引导PPO探索,结合方向性动作一致性正则化,提升强化学习在长时域操作任务中的样本效率,并在仿真和真实机器人上验证。

Comments ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09630 2026-06-09 cs.RO cs.AI cs.LG 新提交 89%

ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies

ReCoVLA: VLM引导的奖励编译用于视觉-语言-动作策略的故障恢复

Haodi Hu, Chung-Ta Huang, Jing Liu, Ye Wang, Kei Suzuki, Matthew Brand, Toshiaki Koike-Akino

机构 * University of Southern California(南加州大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) Harvard University(哈佛大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出ReCoVLA框架,通过冻结预训练VLA策略,利用外部VLM推断故障模式并编译结构化奖励,训练残差恢复策略,实现零样本仿真到真实部署,在多种操作任务中提升成功率。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00212 2026-06-02 astro-ph.GA astro-ph.EP astro-ph.SR 89%

Subarcsecond Multi-line Observations of NH$_3$ with VLA toward the Class 0 Source IRAS 16293-2422

利用VLA对Class 0源IRAS 16293-2422进行亚角秒多谱线NH$_3$观测

Yoshihide Yamato, Yuri Aikawa, Kenji Furuya, John J. Tobin, Jes K. Jørgensen

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 利用VLA对Class 0多星系统IRAS 16293-2422进行亚角秒分辨率NH$_3$分子发射线观测,探测到17条反演跃迁线,通过双组分模型约束了源A和源B的旋转温度和柱密度,揭示了高温气体来源(源A为局部激波加热,源B为内部吸积加热)。

Comments 24 pages, 16 figures, accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00054 2026-06-02 cs.RO cs.AI cs.CV 89%

From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data

从人类视频到机器人操作:基于人类中心数据的可扩展视觉-语言-动作学习综述

Zhiyuan Feng, Qixiu Li, Huizhi Liang, Rushuai Yang, Yichao Shen, Zhiying Du, Zhaowei Zhang, Yu Deng, Li Zhao, Hao Zhao, Zongqing Lu, Oier Mees, Marc Pollefeys, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) HKUST(香港科技大学) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Microsoft Zurich Project(微软苏黎世实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文综述了如何将丰富的人类视频转化为视觉-语言-动作(VLA)模型的有效知识,分类了四种方法(潜在动作表示、预测世界模型、显式2D监督、显式3D重建),并指出了结构化非结构化视频、跨具身和视角的动作映射、以及评估协议设计三大挑战。

Comments Accepted to IJCAI 2026 Survey Track. Project page: https://aaronfengzy.github.io/HumanCentricToVLA-Survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00078 2026-05-04 cs.RO cs.CV cs.LG 89%

Being-H0.7: A Latent World-Action Model from Egocentric Videos

Being-H0.7: 一种从第一人称视频中学习的潜在世界-动作模型

Hao Luo, Wanpeng Zhang, Yicheng Feng, Sipeng Zheng, Haiweng Xu, Chaoyi Xu, Ziheng Xi, Yuhui Fu, Zongqing Lu

机构 * BeingBeyond Team(BeingBeyond团队)

专题命中 VLA模型 :VLA(summary_cn,abstract);action model(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出Being-H0.7,通过在感知与动作之间插入可学习的潜在查询,实现未来感知的VLA策略,无需生成未来帧,提升预测效率与部署性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13710 2026-08-21 cs.LG 版本更新 89%

HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models

HBVLA: 推动面向视觉-语言-动作模型的1位后训练量化

Xin Yan, Zhenglin Wan, Feiyang Ye, Xingrui Yu, Hangyu Du, Yang You, Ivor Tsang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.LG

AI总结 HBVLA通过改进的二值化框架,实现对视觉-语言-动作模型的高效1位量化,保留了高精度性能,适用于资源受限的机器人部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24060 2026-08-13 cs.RO 版本更新 89%

RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统

Zhuoran Li, Zhiyang Li, Kaijun Zhou, Jinyu Gu

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。

Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02497 2026-08-04 cs.RO 新提交 89%

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models

面向视觉-语言-动作模型的鲁棒指令泛化的基础语义重绑定

Zhaokai Yin, Zhipeng Zhang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对视觉-语言-动作模型因指令释义导致性能骤降的架构问题,提出GSR方法,在LIBERO-Para基准提升成功率44.6%,推出ParaVLA模型,规避低效数据扩展,实现鲁棒指令泛化。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08575 2026-08-04 cs.RO 版本更新 89%

FabriVLA: A Lightweight Vision-Language-Action Model with Conformal Action Chunk Uncertainty

FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型

Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15257 2026-08-04 cs.RO 版本更新 89%

HapticVLA: Contact-Rich Manipulation via Vision-Language-Action Model without Inference-Time Tactile Sensing

HapticVLA:通过视觉-语言-动作模型实现接触丰富的操作,无需推理时触觉感知

Konstantin Gubernatorov, Mikhail Sannikov, Ilya Mikhalchuk, Egor Kuznetsov, Makar Artemov, Ogunwoye Faith Oluwatobi, Marcelino Fernando, Artem Asanov, Ziang Guo, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克洛夫科学与技术研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 HapticVLA通过视觉-语言-动作模型实现接触丰富的操作,无需触觉传感器,在现实实验中成功率达到86.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11567 2026-08-03 cs.CV 版本更新 89%

Dynamic Execution Commitment of Vision-Language-Action Models

视觉-语言-动作模型的动态执行承诺

Feng Chen, Xianghui Wang, Yuxuan Chen, Boying Li, Yefei He, Zeyu Zhang, Yicheng Wu

机构 * University of Adelaide(阿德莱德大学) Sichuan University(四川大学) Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学) Zhejiang University(浙江大学) Imperial College London(伦敦帝国理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出A3机制,通过将动态执行承诺重新定义为自推测前缀验证问题,解决了视觉-语言-动作模型在动态或分布外情况下执行鲁棒性和推理吞吐量之间的平衡问题。

Comments code is available at https://inceptionwang.github.io/A3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26513 2026-07-30 cs.RO 新提交 89%

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

面向视觉-语言-动作模型的来自解析概念的显式运动学引导

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23531 2026-07-16 cs.RO 版本更新 89%

BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation

BiliVLA: 基于强化学习的场景感知视觉-语言-动作模型用于自主胆道内镜导航

Jinsong Lin, Chi Kit Ng, Zhiyong Xiong, Zikang Pan, Yihan Hu, Tabassum Tamima, Ziyi Hao, Eddie Cheung, Jiewen Lai, Huxin Gao, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院) University of Cambridge(剑桥大学) University of California, Davis(加州大学戴维斯分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出BiliVLA框架,将胆道内镜导航建模为指令条件化的视觉运动学习问题,结合场景感知监督和两阶段训练(SFT+GRPO),在ERCP子任务中实现91.96%的动作精度和84.85%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31723 2026-07-01 cs.RO 新提交 89%

UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models

UniTacVLA:视觉语言动作模型中的统一触觉理解与预测

Xidong Zhang, Yichi Zhang, Jiaxin Shi, Fucai Zhu, Siyu Zhu, Michael Yu Wang, Xiaojun Wu, Weihao Yuan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Great Bay University(大湾区大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics

专题命中 VLA模型 :vision language action(title);action model(title);VLA(abstract,abstract_cn);vision-language-action(abstract)

AI总结 提出统一触觉学习框架,通过触觉链式推理和由粗到细的未来触觉预测构建状态与动力学感知先验,并设计触觉-动作混合控制器,在接触丰富操作任务中提升成功率、精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31160 2026-07-01 cs.CV 新提交 89%

Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

面向自动驾驶中高效视觉-语言-动作模型的推理感知推测解码

Anh Dung Dinh, Simon Khan, Flora Salim

机构 * Air Force Research Laboratory(空军研究实验室)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出推理感知推测解码框架,通过例程推理器处理常规推理、审慎推理器处理异常情况,结合FlatRoPE和AARL技术,将推理步骤运行时间降低约4倍。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25044 2026-06-30 cs.RO 89%

X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models

X-DiffVLA:面向视觉-语言-动作模型的跨具身扩散动作头

Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Haoran Li, Zongqing Lu, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(SKL-MAIS,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) BeingBeyond School of Computer Science, Peking University(北京大学计算机学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对跨具身数据学习通用策略的挑战,提出X-DiffVLA模型,通过扩散模型和具身强制技术实现异构末端执行器间的知识迁移,在RoboCasa和Isaac Gym上分别提升15.3%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22540 2026-06-26 cs.CV 新提交 89%

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

PolicyTrim: 提升视觉-语言-动作模型的内在策略效率

Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) Adelaide University(阿德莱德大学) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出PolicyTrim框架,通过强化学习后训练扩展动作块可靠长度并减少冗余物理步骤,实现高达5.83倍的端到端部署加速且不降低任务成功率。

Comments Accepted by ECCV 2026. Project page: https://inceptionwang.github.io/PolicyTrim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25985 2026-06-25 cs.RO 新提交 89%

Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

Action ControlNet: 一种轻量级延迟感知适配器,用于视觉-语言-动作模型中的平滑异步控制

Tiecheng Guo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出Action ControlNet,一种轻量级延迟感知适配器,通过将已执行的动作后缀作为残差条件,在不重新训练骨干网络的情况下,减少异步执行中的动作不连续和抖动,提升机器人操控的鲁棒性和平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24815 2026-06-25 cs.SE cs.RO 新提交 89%

MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models

MANGO: 面向视觉-语言-动作模型的自动化多智能体测试预言生成

Pablo Valle, Shaukat Ali, Aitor Arrieta, Lionel Briand

机构 * Mondragon University(蒙得龙大学) Simula Research Laboratory(Simula研究实验室) University of Ottawa(渥太华大学) Research Ireland Lero Centre for Software(爱尔兰Lero软件研究中心)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出MANGO多智能体框架,从自然语言任务描述自动生成细粒度测试预言,通过协作智能体迭代精炼,在机器人基准测试中有效检测故障并定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21493 2026-06-23 cs.CV cs.ET 新提交 89%

Semi-Supervised Vision-Language-Action Model

半监督视觉-语言-动作模型

Hongyang He, Jiuming Liu, Victor Sanchez

机构 * University of Warwick(华威大学) University of Cambridge(剑桥大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出SemiVLA框架,通过自蒸馏教师-学生网络利用伪动作标签适应新环境,在10%标注轨迹下提升LIBERO任务成功率8.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20754 2026-06-23 cs.RO 新提交 89%

Perturbation-Based Uncertainty for Failure Detection in Vision-Language-Action Models

基于扰动的视觉-语言-动作模型不确定性用于故障检测

Yousung Lee, Dongsoo Har

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种无标签、模型无关的扰动框架,通过注入高斯扰动到隐藏激活中估计认知不确定性,在分布偏移下提升故障检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18464 2026-06-15 cs.LG 版本更新 89%

AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models

AcceRL: 面向视觉-语言-动作模型的分布式异步强化学习与世界模型框架

Chengxuan Lu, Shukuan Wang, Yanjie Li, Yingying Fang, Huoyan Wang, Tian Zhang, Wei Liu, Shiji Jin, Fuyuan Qian, Peiming Li, Chao Xu, Baigui Sun, Yang Liu

机构 * IROOTECH TECHNOLOGY Wolf 1069 b Lab, Sany Group(伊罗科技沃尔夫1069b实验室,三一集团)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.LG

AI总结 提出AcceRL框架,通过物理隔离环境交互、模型推理和梯度更新实现分布式异步强化学习,消除同步系统的空闲气泡,提升硬件利用率,并支持即插即用的世界模型集成,在LIBERO任务上实现2.4倍吞吐加速和200倍样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00321 2026-06-11 cs.RO 版本更新 89%

Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models

具身可解释性:将因果理解与视觉-语言-动作模型的泛化联系起来

Hanxin Zhang, Mingshuo Xu, Abdulqader Dhafer, Shigang Yue, Hongbiao Dong, Zhou Daniel Hao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出干预显著性评分(ISS)和干扰质量比(NMR),通过干预掩码估计视觉区域对动作预测的因果影响,并量化对任务无关特征的归因,实验表明NMR可预测泛化行为,ISS比现有方法提供更忠实的解释。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08684 2026-06-09 cs.CV 新提交 89%

BLUE: Toward Better Language Use in Efficient Vision-Language-Action Models for Autonomous Driving

BLUE:迈向自动驾驶高效视觉-语言-动作模型中更好的语言使用

George Ling, Lijin Yang, Hao Yang, Zhongzhan Huang

机构 * Bosch Research(博世研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出BLUE方法,通过轻量门控机制在视觉-语言-动作模型中按帧决定是否激活语言生成,实现性能提升和2.54倍推理加速。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏