arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 594 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 594 篇

2608.10976 2026-08-12 cs.AI 新提交 92%

XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving

XCoT-VLA:面向视觉-语言-动作自动驾驶的可执行思维链

Foundation Model Team, XPeng Inc

机构 * XPeng Inc(小鹏汽车)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);分类 cs.AI

AI总结 该研究提出XCoT-VLA,用可执行CoT令牌替代自然语言CoT,结合Reason FFN与Control FFN实现轨迹生成,在自动驾驶任务中降低了误差并满足实时规划要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07619 2026-08-11 cs.RO 新提交 92%

GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning

GWM-VLA:面向视觉-语言-动作学习的几何感知隐式世界建模

Yanping Zhao, Hang Yu, Yiwei Wang, Chen Ye, Siyu Tian, Di Zhang, Qingjun Wang, Qian Chen, Junqiao Zhao, Chen Ye, Guang Chen

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);分类 cs.RO

AI总结 针对VLA模型在视觉/环境变化下性能下降问题,提出GWM-VLA框架,通过几何感知多视角编码等技术提升模型鲁棒性,经仿真和真实环境实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27146 2026-06-26 cs.RO 新提交 92%

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Xiamen University(厦门大学) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);分类 cs.RO

AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25591 2026-06-25 cs.RO 新提交 92%

WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning

WOLF-VLA:面向视觉-语言-动作学习的全身人形最优运动框架

Melya Boukheddimi, Omar Adjali, Daniel Sontag, Frank Kirchner

机构 * Robotics Innovation Center, DFKI GmbH(德国人工智能研究中心机器人创新中心) University of Oldenburg(奥尔登堡大学) AG Robotik University of Bremen(不来梅大学机器人工作组)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);分类 cs.RO

AI总结 提出WOLF-VLA框架,结合全身最优控制运动合成与大规模多模态数据集,训练VLA模型从自然语言指令生成人形运动策略,在多种任务中展现强鲁棒性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15502 2026-08-18 cs.AI cs.RO 新提交 92%

EcoVLA: Energy-Efficient Device-Edge Co-Inference for Vision-Language-Action Models under Real-Time Constraints

EcoVLA:面向实时约束的视觉-语言-动作模型的节能设备-边缘协同推理

Ao Zhou, Bo Dai, Le Yu, Xingyu Liu, Zeyu Hao, Lingkun Long, Chunming Hu, Jianlei Yang

机构 * Beihang University(北京航空航天大学) Beijing University of Technology(北京工业大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(summary_cn,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 EcoVLA是面向VLA模型的自适应设备-边缘协同推理框架,可在实时约束下最大化能效,提升能效达236%,同时保持服务水平目标满足。

Comments Accepted by APPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25487 2026-07-29 cs.AI cs.CV 新提交 92%

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

CoTinyVLA:用于十亿参数以下视觉-语言-动作模型的思维链蒸馏

Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

机构 * Chung-Ang University(韩国中央大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对VLA模型内存需求大问题,提出CoTinyVLA模型。通过双视图时间输入、分层思维链蒸馏、释义增强三个组件,在LIBERO-Plus基准测试中取得优异成绩,证明结构化监督可让小参数主干超越其他模型。

Comments 22 pages, 2 figures, 20 tables. Code at https://github.com/BrainJellyPie/CoTinyVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01212 2026-07-02 cs.RO cs.AI 新提交 92%

FurnitureVLA: Learning Long-Horizon Bimanual Furniture Assembly with Vision-Language-Action Model

FurnitureVLA: 使用视觉-语言-动作模型学习长时域双臂家具组装

Chenyang Ma, Yue Yang, Radu Corcodel, Siddarth Jain, Andrew Wu, Chiori Hori, Diego Romeres

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出FurnitureVLA,首个使用视觉-语言-动作模型进行真实尺寸双臂家具组装的系统,通过进度增强VLA和设计因素研究,将平均模拟成功率从48%提升至80%。

Comments Project Page: https://dannymcy.github.io/furniturevla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13924 2026-08-17 cs.RO 新提交 92%

BICPO-VLA: Behavior-Identified Continuation Preference Optimization for Smooth Asynchronous Vision-Language-Action Control

BICPO-VLA:用于平滑异步视觉-语言-动作控制的行为识别延续偏好优化

Ming Shang, Yuchen Huang, Jiaoyang Chen, Haoyuan Hu, Han Yu, Liping Song, Luyun Feng, Shuo Bao, Wei Dong, Xinzhou Wang, Fuchun Sun

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title);分类 cs.RO

AI总结 BICPO-VLA针对异步视觉-语言-动作控制的请求交接间隙问题,通过行为识别、动作分解重建、参考相对Flow-DPO优化,实现平滑控制。

Comments 9 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23623 2026-06-23 cs.RO 新提交 92%

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 92%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15714 2026-06-16 cs.CL cs.RO 新提交 92%

Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models

超越英语:揭示视觉-语言-动作模型中的多语言差距

Hanyang Chen, Hongliang Li, Jiarui Cao, Yang Li, Yang Jiang, Haonan Wen, Kaiyu Huang, Shengnan Guo, Huaiyu Wan

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 本研究首次系统探究VLA模型的多语言指令跟随能力,发现英语训练模型在其他语言上性能显著下降,并提出多语言主成分对齐方法缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12403 2026-06-11 cs.RO 新提交 92%

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

World Pilot: 用世界动作先验引导视觉-语言-动作模型

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。

Comments Project Website: https://world-pilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09740 2026-06-09 cs.RO 新提交 92%

ProbeAct: Probe-Guided Training-Free Failure Recovery in Vision-Language-Action Models

ProbeAct: 视觉-语言-动作模型中的探针引导无训练故障恢复

Fan Zhang, Seongbin Park, Baharan Mirzasoleiman, Shariar Talebi, Nader Sehatbakhsh

机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);language-conditioned robot(abstract)

AI总结 提出ProbeAct框架,通过轻量级隐藏状态探针、运动学状态机和分层控制屏障函数,无需训练即可检测并恢复VLA模型的抓取与放置失败,在LIBERO-plus上将成功率从69.6%提升至74.1%。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19066 2026-08-20 cs.CV cs.AI 新提交 92%

GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting

GS-VLA:基于高斯溅射的冻结VLA策略的即插即用视角规范化方法

Yechan Park, HyunJin Kim

机构 * Dankook University(檀国大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 GS-VLA是首个基于3D高斯的VLA视角规范化即插即用框架,通过轻量4M参数的3D高斯规范化器提升VLA策略视角偏移鲁棒性,无需重训即可在多维度恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15636 2026-08-18 cs.RO cs.AI 新提交 92%

Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification

结合推测推理与验证的高效VLA推理的算法-架构协同设计

Chunyu Qi, Zhuoran Song, Jian Weng, Haozhe Jiang, Xueyuan Liu, Naifeng Jing, Guanghui He, Xiaoyao Liang, Haibing Guan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Computer Science, King Abdullah University of Science and Technology(阿卜杜拉国王科技大学计算机科学学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 针对VLA模型推理延迟高、动作长度有限的问题,提出SpecVLA算法-架构协同框架,通过状态感知推理、sVLA验证模型与异构架构,在保持任务成功率的同时降低延迟,实现高效可靠的实时机器人操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06564 2026-07-08 cs.RO cs.CV 新提交 92%

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14635 2026-07-17 cs.AI cs.CV cs.RO 新提交 92%

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

机构 * Shanghai Qizhi Institute(上海期智研究院) The Chinese University of Hong Kong(香港中文大学) Hong Kong Embodied AI Lab(香港具身人工智能实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23617 2026-06-23 cs.RO cs.AI cs.LG 新提交 92%

RECALL: Recovery Experience Collection for Active Lifelong Learning in Vision-Language-Action Models

RECALL: 面向视觉-语言-动作模型的主动终身学习的恢复经验收集

Ulas Berk Karli, Tesca Fitzgerald

机构 * Yale University(耶鲁大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI、cs.LG

AI总结 提出主动不确定性引导的数据收集方法,结合持续学习技术,解决VLA模型被动模仿学习中的效率低和灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20857 2026-06-23 cs.AI cs.LG cs.RO 新提交 92%

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA: 通过注意力LSTM和视觉-语言-动作模型实现实时手语引导的机器人操作

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * University College London(伦敦大学学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI、cs.LG

AI总结 提出SignVLA框架,通过注意力LSTM网络将手语手势实时转换为语义指令,驱动VLA模型执行机器人操作任务,为听障用户提供无障碍交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15099 2026-06-16 cs.CV cs.LG cs.RO 新提交 92%

Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models

少思考,早行动:视觉-语言-动作模型中带早退的强化潜在推理

Dianqiao Lei, Lianlei Shan

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.LG

AI总结 提出AVA-VLA框架,通过强化学习去噪和早退策略优化潜在推理轨迹,在LIBERO上实现6倍推理加速和98.3%平均成功率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11906 2026-06-11 cs.CL 新提交 92%

When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models

语言何时重要?多语言指令揭示视觉-语言-动作模型中的逐步语言敏感性

Xuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);language-conditioned robot(abstract)

AI总结 本研究通过将LIBERO基准翻译成十种语言,首次系统评估了VLA模型的多语言鲁棒性,发现非英语指令下成功率下降30-50%,并基于步骤级语言敏感性提出推理时对齐干预,显著提升性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07608 2026-07-09 cs.RO cs.CV 新提交 92%

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

用于机器人操作的视觉-语言-动作模型中的双潜记忆

Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 研究针对主流VLA模型处理长期任务的不足,提出LaMem-VLA框架,通过四个协调组件将历史经验重构为潜记忆令牌并与VLA推理直接交织,实现在同一潜空间处理历史经验,经实验验证该框架具有优越性。

Comments Project page: https://github.com/quhongyu/LaMem-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06374 2026-08-07 cs.RO 新提交 92%

DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation

DyPES-VLA:学习共享动态先验与具身特定控制以实现跨具身操作

Junfeng Li, Junjie He, Zhide Zhong, Yangyang Zheng, Pingyue Sheng, Jiayu Dong, Ruixin Li, Haodong Yan, Jiaguan Zhu, Tianran Zhang, Runze Yu, Wen Chen, Liuqing Yang, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 该研究针对跨具身机器人操作问题,提出DyPES-VLA模型,通过学习共享动态先验与具身特定MoE动作头,在LIBERO等数据集上达到先进操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04517 2026-07-07 cs.AI 新提交 92%

VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models

VLA 接地器:用于黑盒 VLA 模型的语言条件空间优化

Damir Shodiev, Aleksei Staroverov, Nikita Kachaev, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX MIRAI(未来人工智能研究机构) MISIS(俄罗斯国立科技大学莫斯科钢铁合金学院)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);robot foundation model(abstract);分类 cs.AI

AI总结 研究能否通过优化语言空间而非更新动作权重来改进冻结的 VLA 策略,提出语言条件空间策略,用强化学习优化,实验表明该优化能提升特定任务成功率,证明语言可作为机器人基础模型的可优化变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02840 2026-07-07 cs.RO 新提交 92%

TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training

TACO:作为可扩展VLA训练后自校正器的触觉世界模型

Shengbang Liu, Yueru Jia, Yuyang Yan, Jiaming Liu, Xinran Zhang, Qiuxuan Feng, Yandong Guo, Shiji Zhou, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) AI 2 Robotics(人工智能与机器人研究所) Sun Yat-sen University(中山大学) Beihang University(北京航空航天大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 研究VLA模型在接触丰富任务中的问题,提出TACO框架,通过触觉感知世界模型驱动可扩展VLA训练后校正,结合多种方法提升策略,实验表明其能显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00351 2026-07-02 cs.RO 新提交 92%

Unleashing More Actions via Action Compositional Training for VLA Models

通过动作组合训练释放VLA模型的更多动作

Kai Peng, Jie Lu, Xiaojiang Peng

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对VLA模型因过拟合特定行为模式而无法泛化到新动作组合的问题,提出ACT-VLA框架,利用模型潜在任务表示从现有任务中合成新演示数据,无需额外人工采集,有效缓解过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13856 2026-06-15 cs.RO 新提交 92%

Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning

输出级正则化消除单GPU VLA微调中的种子彩票

Jeffrin Sam, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯科尔科沃科学技术研究所)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 发现单GPU微调VLA-JEPA时存在种子彩票现象(随机种子导致性能骤降29%),归因于输出坍塌,提出输出级正则化(VICReg、Dropout、减半学习率)可完全消除该问题。

Comments 10 pages, 8 figures, submitted to CoRL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16503 2026-08-18 cs.RO cs.AI 新提交 91%

NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation

NebulaVLA:用于机器人操纵的带引导动作的双频视觉-语言-动作模型

Cong Zhao, Shuai Tian, Xu Zhang, Baocheng Ni, Xinguo Song, Xueying Sun, Shu Jiang, Shouchang Yang, Bo Tang, Jin Deng, Ge Zhu, YongCheng Wang, Jin Xu, Ri Yang

机构 * ZTE Corporation(中兴通讯股份有限公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 NebulaVLA是一种异步双频VLA模型,通过解耦语义推理与动作控制、引入GESTURE-7表示及引导动作算法,在LIBERO-Plus上以85.5%成功率、约2.7倍速度优于同步基线,实现高效机器人操纵控制。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14822 2026-08-18 cs.RO cs.CV 新提交 91%

Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models

想象恢复:视觉-语言-动作模型的推理时反事实重对齐

Yanyan Zhang, Disheng Liu, Kai Ye, Chaoda Song, Xinpeng Li, Mohsen Hariri, Vikash Singh, Yu Yin, Vipin Chaudhary

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 针对VLA模型易受在线干扰的问题,提出无需训练的CoRe框架,通过反事实想象与最小重对齐实现无试错恢复,大幅提升任务成功率并减少物理恢复操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14379 2026-08-17 cs.RO cs.AI 新提交 91%

Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation

Reflex:面向反应关键型操作的快速且可预测的视觉-语言-动作模型

Yuxuan Chen, Wanruo Zhang, Xiao Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 针对现有VLA模型忽略动态交互场景的问题,提出面向反应关键型操作的ReflexBench基准与无需大规模机器人数据预训练的ReflexVLA模型,其可提升动态操作性能并保持静态操作精度。

Comments 8 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏