PointVLA: Injecting the 3D World into Vision-Language-Action Models
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.LG
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.LG
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.LG
Comments Accepted to ICRA 2025
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV、cs.AI、cs.LG
UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型
机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV
AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。
3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务
机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) ; New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)
专题命中 VLA模型 :vision language action(title);action model(title);VLA(abstract,comments);vision-language-action(abstract)
AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。
Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication
您的视觉-语言-动作模型已具备路径偏差检测的注意力头
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV
AI总结 本文提出一种无需训练的异常检测框架,通过监控VLA模型中的三个注意力头实时检测路径偏差,并利用轻量级RL策略进行恢复,展示了其在物理机器人上的实际鲁棒性。
Comments Keywords: Vision-Language Action (VLA), Reinforcement Learning (RL), Navigation Path Recovery, Robot Operating System (ROS)
DynamicVLA: 一种用于动态物体操控的视觉-语言-动作模型
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV
AI总结 DynamicVLA通过整合时间推理和闭环适应,提出了一种用于动态物体操控的视觉-语言-动作模型,提升了响应速度和泛化能力。
Comments Project Page: https://www.infinitescript.com/project/dynamic-vla/ GitHub: https://github.com/hzxie/DynamicVLA
视觉-语言-动作模型中的置信度校准
机构 * Columbia University(哥伦比亚大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.LG
AI总结 本文提出通过提示集合和动作-wise Platt缩放技术,改进视觉-语言-动作模型的置信度校准,以提升机器人行为的可靠性和性能。
Comments 38 pages, 19 figures; additional experiments with VLA variants
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV
Comments Homepage: https://aopolin-lv.github.io/F1-VLA/
机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV
Comments Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.LG
Comments CoRL 2025. Project website: https://vla-mech-interp.github.io/
EXIMO:基于视觉语言模型引导的视觉语言动作策略探索
机构 * Google DeepMind(谷歌DeepMind)
专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.AI
AI总结 本研究提出EXIMO算法,通过VLM引导的探索、模仿、优化三阶段微调VLA策略,解决了VLA策略微调样本效率低的问题,性能显著优于现有方法。
用于高效视觉-语言-动作策略的角色条件子令牌路由
机构 * Futurewei Technologies(未来智能技术公司)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.LG
AI总结 该研究针对VLA模型推理成本高的问题,提出RoleSub方法,通过角色条件子令牌路由压缩视觉和语言表示,在匹配视觉-KV预算下多数场景优于仅令牌控制,结合压缩后总KV仅为原始的9.2-11.3%且控制性能强。
Comments 12 pages, 5 tables
FlashDrive:面向自动驾驶的Flash视觉-语言-动作推理
机构 * Princeton(普林斯顿大学) ; UC San Diego(加州大学圣迭戈分校)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.AI
AI总结 FlashDrive通过算法-系统协同设计解决VLA推理的四个级联瓶颈,使Alpamayo 1.5-10B的端到端自动驾驶延迟降4.7倍,推理频率提升至6.6Hz,逼近实时部署。
Comments 15 pages; 8 figures
BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; FiveAges ; ByteDance Seed(字节跳动种子实验室)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO
AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。
Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
ChainVLA:通过统一执行状态串联视觉-语言-动作查询以实现长 horizon 操纵
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO
AI总结 ChainVLA 是 12 亿参数的 VLA 策略,通过联合可修订的执行状态串联查询,结合进展上下文与运动尾部,在长 horizon 操纵任务中大幅提升成功率, ablation 验证了两个组件的关键作用。
Comments 13 pages (9 main + 4 appendix), 4 figures. Project page: https://muqy1818.github.io/chainvla-web/
基于VLA的智能体长期记忆在开放世界任务执行中的应用
机构 * Nanjing University(南京大学) ; LimX Dynamics(LimX 动态)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO
AI总结 本文提出ChemBot框架,通过双层记忆和MCP服务器提升复杂化学实验中的任务执行效率与安全性。
Comments Added references
RynnBrain 1.1:迈向更具能力和通用性的具身基础模型
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(湖畔实验室)
专题命中 VLA模型 :VLA(summary_cn,abstract);embodied foundation model(title,abstract);分类 cs.RO
AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。
Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11
用于视觉语言动作模型测试时模态适应的因果感知推理-诊断-细化框架
机构 * Beijing Institute of Technology(北京理工大学) ; AInnovation Co. Ltd.(A创新有限公司) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO
AI总结 针对VLA模型模态融合问题,提出因果感知推理-诊断-细化框架,通过视觉观察推理、因果效应诊断及动作预测细化实现模态适应,设计因果感知动作细化器,实验验证了该框架在多VLA主干上提升整体性能的有效性。
一种用于高效视觉-语言-动作推理的具有质心重用的运动感知向量量化框架
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.AI
AI总结 针对VLA模型推理延迟高问题,提出VQVLA算法-硬件协同设计框架,利用MotionVQ动态调整量化精度,采用合并质心向量量化通用矩阵乘法范式,设计加速器,实验表明其相比多种方法有显著加速且精度损失小。
人形机器人视觉语言动作闭环:用于可验证移动操作的持久3D对象令牌
机构 * BUAA(北京航空航天大学) ; DeepCybo(深灵机器人) ; ZGCI(未提及具体中文译名)
专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO
AI总结 研究人形机器人视觉语言动作中对象状态差异问题,提出持久对象令牌化方法(POT)并实例化为POT-VLA,通过RGB-D观察维护3D对象记录,转换为对象令牌用于动作生成与验证,实验表明该方法提升了任务成功率。
JoyNexus:面向服务的视觉语言动作模型多租户训练后处理
机构 * Peking University(北京大学) ; Beihang University(北航) ; Beijing Institute of Technology(北京理工大学) ; Tsinghua University(清华大学)
专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.AI
AI总结 针对VLA模型训练后处理问题,提出JoyNexus统一服务,解耦相关服务,多租户可通过API调用,引入组批处理提高效率,经评估能减少GPU时间,提升服务利用率。
Comments 23 pages, 12 figures
灯光、相机、故障:当光照鲁棒性使视觉语言动作模型对颜色视而不见时
机构 * Keio University(庆应义塾大学)
专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO
AI总结 研究VLA模型在现实环境中对光照干扰的脆弱性,提出FLARE攻击框架和ChromaGuard对抗训练方法,通过实验验证ChromaGuard能有效提升模型在颜色相关任务中的成功率,保障模型在复杂环境下的性能。
MotuBrain: 一种先进的世界动作模型用于机器人控制
机构 * MotuBrain Team(MotuBrain团队)
专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO
AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。
ExToken:用于高效视觉-语言-动作强化微调的结构化探索
机构 * Nanyang Technological University(南洋理工大学) ; ACE Robotics(ACE机器人公司) ; Zhejiang University(浙江大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO
AI总结 研究VLA模型强化学习中探索停滞问题,提出ExToken框架,基于离线演示导出的离散行为先验调整VLA策略进行结构化探索,通过不同令牌鼓励多样行为模式,提升了探索效率与任务性能,在多任务实验中表现良好。
减少时间冗余以实现高效视觉-语言-动作推理
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO
AI总结 研究针对VLA模型推理延迟高的问题,识别出时间冗余来源,提出系统级加速策略,在感知和动作生成上减少计算,经实验验证该策略能加速超2倍且保持高性能。
Comments 13pages, 7 figuers
三思而后行:将树搜索提炼为冻结视觉语言动作模型的动作评估
机构 * Nanjing University(南京大学) ; Australian National University(澳大利亚国立大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Nvidia(英伟达)
专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO
AI总结 研究发现视觉语言动作(VLA)模型泛化能力差的关键瓶颈在于动作评估。提出SVA框架,通过蒙特卡洛树搜索探索输出分布,将知识提炼到轻量级Q值模型,提升任务成功率,且保持泛化能力。
Exp2VLA:通过专家示范实现无人机导航的视觉-语言-动作
机构 * Isaac Lab(艾萨克实验室)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO
AI总结 提出用于语言条件无人机导航的专家蒸馏管道Exp2VLA,将专家行为提炼为训练数据微调紧凑VLA模型,实现控制策略转移,降低新行为部署难度,实验表明微调模型可处理多样语义命令。
HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试
机构 * The University of Melbourne(墨尔本大学) ; Melsy Tech(Melsy科技) ; MBZUAI ; Navlyn ; The University of Sydney(悉尼大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.CV
AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。
PAMAE: 面向可靠流匹配视觉-语言-动作策略的相位感知MoE动作专家
机构 * Department of Artificial Intelligence, School of Informatics, Xiamen University(厦门大学信息学院人工智能系) ; Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.RO
AI总结 针对多阶段机器人操作中VLA模型动作生成不可靠的问题,提出即插即用的相位感知混合专家动作模块PAMAE,通过稀疏专家混合和相位感知路由提升阶段一致性,在模拟任务中成功率提升9.2%。