arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9893 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9209 篇

2608.18410 2026-08-20 cs.LG 新提交 89%

Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies

用于高效视觉-语言-动作策略的角色条件子令牌路由

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智能技术公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.LG

AI总结 该研究针对VLA模型推理成本高的问题,提出RoleSub方法,通过角色条件子令牌路由压缩视觉和语言表示,在匹配视觉-KV预算下多数场景优于仅令牌控制,结合压缩后总KV仅为原始的9.2-11.3%且控制性能强。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12932 2026-08-14 cs.AI 新提交 89%

FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving

FlashDrive:面向自动驾驶的Flash视觉-语言-动作推理

Zekai Li, Yihao Liang, Hongfei Zhang, Jian Chen, Yesheng Liang, Zhijian Liu

机构 * Princeton(普林斯顿大学) UC San Diego(加州大学圣迭戈分校)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.AI

AI总结 FlashDrive通过算法-系统协同设计解决VLA推理的四个级联瓶颈,使Alpamayo 1.5-10B的端到端自动驾驶延迟降4.7倍,推理频率提升至6.6Hz,逼近实时部署。

Comments 15 pages; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05042 2026-08-06 cs.RO 新提交 89%

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges ByteDance Seed(字节跳动种子实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。

Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02326 2026-08-05 cs.RO 版本更新 89%

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

ChainVLA:通过统一执行状态串联视觉-语言-动作查询以实现长 horizon 操纵

Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 ChainVLA 是 12 亿参数的 VLA 策略,通过联合可修订的执行状态串联查询,结合进展上下文与运动尾部,在长 horizon 操纵任务中大幅提升成功率, ablation 验证了两个组件的关键作用。

Comments 13 pages (9 main + 4 appendix), 4 figures. Project page: https://muqy1818.github.io/chainvla-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15671 2026-08-04 cs.RO 版本更新 89%

Long-Term Memory for VLA-based Agents in Open-World Task Execution

基于VLA的智能体长期记忆在开放世界任务执行中的应用

Xu Huang, Weixin Mao, Yinhao Li, Hua Chen, Jiabao Zhao

机构 * Nanjing University(南京大学) LimX Dynamics(LimX 动态)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出ChemBot框架,通过双层记忆和MCP服务器提升复杂化学实验中的任务执行效率与安全性。

Comments Added references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17977 2026-08-03 cs.RO 版本更新 89%

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

RynnBrain 1.1:迈向更具能力和通用性的具身基础模型

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Tong Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);embodied foundation model(title,abstract);分类 cs.RO

AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。

Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25516 2026-07-29 cs.RO 新提交 89%

A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models

用于视觉语言动作模型测试时模态适应的因果感知推理-诊断-细化框架

Haoyu Zhang, Yuwei Wu, Jin Chen, Gao Zhi, Zhenxin Diao, Mingyang Gao, Kun Wu, Yongchun Liu, Fan Li

机构 * Beijing Institute of Technology(北京理工大学) AInnovation Co. Ltd.(A创新有限公司) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对VLA模型模态融合问题,提出因果感知推理-诊断-细化框架,通过视觉观察推理、因果效应诊断及动作预测细化实现模态适应,设计因果感知动作细化器,实验验证了该框架在多VLA主干上提升整体性能的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24148 2026-07-28 cs.AI 新提交 89%

A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference

一种用于高效视觉-语言-动作推理的具有质心重用的运动感知向量量化框架

Zhuoran Song, Haozhe Jiang, Chunyu Qi, Minnan Pei, Gang Li, Xiaoyao Liang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.AI

AI总结 针对VLA模型推理延迟高问题,提出VQVLA算法-硬件协同设计框架,利用MotionVQ动态调整量化精度,采用合并质心向量量化通用矩阵乘法范式,设计加速器,实验表明其相比多种方法有显著加速且精度损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18016 2026-07-28 cs.RO 版本更新 89%

Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation

人形机器人视觉语言动作闭环:用于可验证移动操作的持久3D对象令牌

Peng Ren, Haoyang Ge, Jiang Zhao, Cong Huang, Yukun Shi, Pei Chi, Kai Chen

机构 * BUAA(北京航空航天大学) DeepCybo(深灵机器人) ZGCI(未提及具体中文译名)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究人形机器人视觉语言动作中对象状态差异问题,提出持久对象令牌化方法(POT)并实例化为POT-VLA,通过RGB-D观察维护3D对象记录,转换为对象令牌用于动作生成与验证,实验表明该方法提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16074 2026-07-20 cs.DC cs.AI cs.SE 新提交 89%

JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

JoyNexus:面向服务的视觉语言动作模型多租户训练后处理

Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Beihang University(北航) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.AI

AI总结 针对VLA模型训练后处理问题,提出JoyNexus统一服务,解耦相关服务,多租户可通过API调用,引入组批处理提高效率,经评估能减少GPU时间,提升服务利用率。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14698 2026-07-17 cs.RO 新提交 89%

Lights, Camera, Malfunction: When Illumination Robustness Leaves VLA Models Blind to Color

灯光、相机、故障:当光照鲁棒性使视觉语言动作模型对颜色视而不见时

Marino Watanabe, Takami Sato, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究VLA模型在现实环境中对光照干扰的脆弱性,提出FLARE攻击框架和ChromaGuard对抗训练方法,通过实验验证ChromaGuard能有效提升模型在颜色相关任务中的成功率,保障模型在复杂环境下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27792 2026-07-16 cs.RO 版本更新 89%

Motubrain: An Advanced World Action Model for Robot Control

MotuBrain: 一种先进的世界动作模型用于机器人控制

Motubrain Team, Chendong Xiang, Fan Bao, Haitian Liu, Hengkai Tan, Hongzhe Bi, James Li, Jiabao Liu, Jingrui Pang, Kiro Jing, Louis Liu, Mengchen Cai, Rongxu Cui, Ruowen Zhao, Runqing Wang, Shuhe Huang, Yao Feng, Yinze Rong, Zeyuan Wang, Jun Zhu

机构 * MotuBrain Team(MotuBrain团队)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12931 2026-07-15 cs.RO 新提交 89%

ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning

ExToken:用于高效视觉-语言-动作强化微调的结构化探索

Yilun Kong, Yunpeng Qing, Guozheng Ma, Haoyu Wang, Li Shen, Zhi Hou, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) ACE Robotics(ACE机器人公司) Zhejiang University(浙江大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 研究VLA模型强化学习中探索停滞问题,提出ExToken框架,基于离线演示导出的离散行为先验调整VLA策略进行结构化探索,通过不同令牌鼓励多样行为模式,提升了探索效率与任务性能,在多任务实验中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12287 2026-07-15 cs.RO 新提交 89%

Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference

减少时间冗余以实现高效视觉-语言-动作推理

Yuzhou Wu, Yuxin Zheng, Muchun Niu, Yishan Yang, Tianhao Liu, hanwen kang, Jiajian Jing, Linfeng Zhang, Chuan Wen

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 研究针对VLA模型推理延迟高的问题,识别出时间冗余来源,提出系统级加速策略,在感知和动作生成上减少计算,经实验验证该策略能加速超2倍且保持高性能。

Comments 13pages, 7 figuers

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03751 2026-07-07 cs.RO 新提交 89%

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

三思而后行:将树搜索提炼为冻结视觉语言动作模型的动作评估

Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang

机构 * Nanjing University(南京大学) Australian National University(澳大利亚国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nvidia(英伟达)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究发现视觉语言动作(VLA)模型泛化能力差的关键瓶颈在于动作评估。提出SVA框架,通过蒙特卡洛树搜索探索输出分布,将知识提炼到轻量级Q值模型,提升任务成功率,且保持泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03146 2026-07-07 cs.RO 新提交 89%

Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations

Exp2VLA:通过专家示范实现无人机导航的视觉-语言-动作

Van Huyen Dang, Kabilesh Rajendran, Erdi Sayar, Erdal Kayacan

机构 * Isaac Lab(艾萨克实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 提出用于语言条件无人机导航的专家蒸馏管道Exp2VLA,将专家行为提炼为训练数据微调紧凑VLA模型,实现控制策略转移,降低新行为部署难度,实验表明微调模型可处理多样语义命令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19822 2026-07-07 cs.CV 版本更新 89%

HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks

HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试

Jingyu Guo, Ziye Chen, Ziwen Li, Zhengqing Gao, Jiaxin Huang, Hanlue Zhang, Fengming Huang, Yu Yao, Tongliang Liu, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) Melsy Tech(Melsy科技) MBZUAI Navlyn The University of Sydney(悉尼大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.CV

AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27144 2026-06-26 cs.RO 新提交 89%

PAMAE: Phase-Aware-MoE Action Experts Towards Reliable Flow-Matching Vision-Language-Action Policies

PAMAE: 面向可靠流匹配视觉-语言-动作策略的相位感知MoE动作专家

Jiayu Yang, Tao Yang, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Department of Artificial Intelligence, School of Informatics, Xiamen University(厦门大学信息学院人工智能系) Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 针对多阶段机器人操作中VLA模型动作生成不可靠的问题,提出即插即用的相位感知混合专家动作模块PAMAE,通过稀疏专家混合和相位感知路由提升阶段一致性,在模拟任务中成功率提升9.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24448 2026-06-24 cs.RO 新提交 89%

Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos

监督幸存信息:基于几何引导的合成机器人视频VLA适配

Danze Chen, Yanzhe Chen, Qiming Huang, Zhijun Cao, Chen Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学 Show Lab)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出GRA方法,从合成视频中提取几何信息(2D末端执行器路径点)监督视觉表征,仅用真实演示训练动作头,在真实机器人任务中优于伪动作基线。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22836 2026-06-23 cs.RO 新提交 89%

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

Cloak: 通过遮蔽末端执行器实现零样本跨本体操作

Michael Piseno, Guy Tevet, C. Karen Liu

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出Cloak训练方法,通过遮蔽腕部相机中的末端执行器,使VLA模型实现零样本跨本体迁移,无需新本体数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21445 2026-06-23 cs.RO 版本更新 89%

VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies

VLA 知道自己的极限:机器人策略的自适应执行视界

Haoxuan Wang, Gengyu Zhang, Yan Yan, Ramana Rao Kompella, Gaowen Liu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Cisco Research(思科研究)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对流式视觉-语言-动作模型中执行视界影响性能的问题,提出 AutoHorizon 方法,通过分析注意力权重动态估计每块动作的执行视界,提升机器人操作任务性能。

Comments ECCV 2026. Project page at https://hatchetproject.github.io/autohorizon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15568 2026-06-16 cs.RO 新提交 89%

SAPS: Shared Autonomy for Policy Steering by Blending Teleoperation with a Pretrained VLA

SAPS: 通过混合遥操作与预训练VLA的策略引导共享自主性

Crystal Zhou, Jehan Yang, Douglas J. Weber, Zackory Erickson

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出SAPS框架,在动作层面混合人类遥操作命令与预训练策略动作,无需重训练或辅助模型,通过动态余弦相似度仲裁策略提升任务成功率高达82%,并减少人工干预。

Comments 23 pages, 15 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14084 2026-06-15 cs.RO 新提交 89%

Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing

自我改进的VLA策略:用于抗伪影动作平滑的选择性扩散噪声

Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu, Binh Gia Nguyen, Vinh Tong, Anji Liu, Vu N. Duong, Dung D. Le, Daniel Sonntag, Trung Le, Ngan Le, Jan Peter, An Thai Le, Minh Nhat Vu, Mathias Niepert, Khoa D. Doan, Duy M. H. Nguyen, Vien Anh Ngo

机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) VinRobotics KAIST(韩国科学技术院) University of Stuttgart(斯图加特大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院) National University of Singapore(新加坡国立大学) DFKI(德国人工智能研究中心) University of Oldenburg(奥尔登堡大学) Monash University(莫纳什大学) University of Arkansas(阿肯色大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出一种无需训练的选择性扩散噪声方法,通过动态采样噪声向量增强视觉-语言-动作策略的鲁棒性和动作平滑性,在仿真和真实场景中成功率分别提升8%和10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00985 2026-06-02 cs.RO 89%

Make Your VLA More Robust Without More Data By Interleaving Motion Planning

通过交错运动规划使您的VLA更鲁棒而无需更多数据

Dan BW Choe, Sundhar Vinodh Sangeetha, Samuel Coogan, Shreyas Kousik

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出MPVI框架,将基于模型的运动规划与视觉-语言-动作模型交错结合,通过VLM完成检查和本体感受触发实现可靠切换,无需额外训练即可提升长时域移动操作任务的鲁棒性,在BEHAVIOR-1K基准上任务进度提升113%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17502 2026-06-02 cs.RO 89%

RynnVLA-002: A Unified Vision-Language-Action and World Model

RynnVLA-002: 统一的视觉-语言-动作与世界模型

Jun Cen, Siteng Huang, Yuqian Yuan, Kehan Li, Hangjie Yuan, Chaohui Yu, Bohan Hou, Yuming Jiang, Jiayan Guo, Xin Li, Hao Luo, Fan Wang, Deli Zhao, Hao Chen

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 提出统一视觉-语言-动作(VLA)与世界模型的框架RynnVLA-002,通过联合学习环境动态和动作规划,在仿真和真实机器人任务中显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14143 2026-06-02 cs.RO 89%

CLAW: A Vision-Language-Action Framework for Weight-Aware Robotic Grasping

CLAW: 一种面向重量感知机器人抓取的视觉-语言-动作框架

Zijian An, Ran Yang, Yiming Feng, Lifeng Zhou

机构 * Department of Electrical and Computer Engineering, Drexel University(德雷塞尔大学电气与计算机工程系)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO

AI总结 提出CLAW框架,通过解耦条件评估与动作生成,利用微调CLIP模型监控重量阈值并生成提示,结合流式VLA策略实现重量感知的机器人抓取,在单目标与双目标实验中优于基线模型。

Comments 8 pages, 5 figures, Video: https://youtu.be/MuMYj2QgReI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31066 2026-06-01 cs.RO 89%

Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air

空中VLA模型能协作吗?基于CARLA-Air的闭环空地协调评估

Tianle Zeng, Yanci Wen, Xueang Yu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文通过构建CARLA-Air仿真环境,评估空中视觉-语言-动作模型在空地协作任务中的表现,发现当前模型难以将单智能体能力转化为稳定协作行为,并指出零样本协作需要伙伴状态显式感知、低延迟动作协调和团队目标对齐三个关键组件。

Comments Code at https://github.com/louiszengCN/CarlaAir

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13382 2026-05-14 cs.RO 89%

BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning

BlockVLA: 通过块扩散微调加速自回归VLA

Ruiheng Wang, Shuanghao Bai, Haoran Zhang, Badong Chen, Xiangyu Xu

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出BlockVLA框架,通过块扩散方法将预训练自回归模型转化为高效离散扩散策略,减少推理延迟并提升训练效率,实验证明在复杂长周期任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19589 2026-08-21 cs.RO cs.CV 新提交 88%

OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation

OrthoSkillVLA:通过梯度感知技能子空间自适应实现持续技能学习

Jiaqi Wang, Zhou Fang, Qiongfeng Shi, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Electronic Science and Engineering, Southeast University(东南大学电子科学与工程学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);action model(abstract);分类 cs.RO、cs.CV

AI总结 OrthoSkillVLA是一种参数高效的持续技能学习框架,通过对VLM和ActionHead施加独立子空间约束、引入特征感知MoE解码器,实现预训练VLA模型的技能学习,可缓解灾难性遗忘。

Comments Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10484 2026-08-12 cs.RO cs.AI cs.CL 新提交 88%

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

在重建中迷失:将视觉-语言-动作模型中的动作表示与语言对齐

Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对视觉-语言-动作模型中动作表示与语言脱节的问题,提出SALT语义对齐动作标记器,在SimplerEnv中使策略平均成功率达71.9%,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏