一个机器人模型换到预训练阶段从未见过的人形本体,只用20%的下游轨迹就拿到49.5%的任务成功率,高于GR00T-N1.6使用全部下游数据时的47.6%。这项结果来自VLAct,一套把持续预训练重点从“继续堆机器人数据”转向“先把表示学好”的视觉—语言—动作模型方案。
论文公开页面未披露作者机构。作者将模型、训练管线和实验设置一并公开,但论文仍是预印本;最醒目的20%对100%结果来自RoboCasa-GR1仿真基准,不能直接换算成真实工厂里的数据成本。
数据难扩,先保护视觉语言底座
视觉—语言—动作模型先看图像和文字指令,再预测机器人动作。问题在于,网页图文可以大规模收集,真实机器人轨迹却要一条条操作、校准和记录。同样的数据预算下,持续预训练若只让骨干网络拟合某一种动作头,很容易损失原有的视觉和语言能力,换一台机器人后还得重新适配。
VLAct从预训练视觉语言模型出发,在多种机器人、多类任务的异构轨迹上继续训练。它冻结视觉编码器和语言模型较浅层的一部分参数,减少物理动作训练对通用表征的侵蚀;同时保留任务相关的深层更新空间。论文消融中,保护视觉编码器和较浅语言层的配置,在LIBERO-Plus上达到82.6%,高于全骨干更新的78.9%。
图1:VLAct保护视觉语言先验,同时用多种动作头和统一动作空间训练跨本体表示。
多个动作头一起教,骨干不再被一种输出绑住
机器人系统对动作的表达并不统一。有的直接回归连续关节值,有的预测离散动作Token,还有的用流匹配生成一段动作。若预训练只绑定一个动作头,骨干会为这种输出方式过度特化,迁移时更换动作头,已有能力未必能保留。
VLAct在持续预训练阶段加入多头连续动作协同监督,并把不同本体的关节映射到部分统一的动作布局。共享维度学习跨机器人的动作语义,无法对齐的维度仍留给本体自己的动作头。下游团队可以接OFT、π式或GR00T式动作头,不必把预训练时的解码器原样搬过去。
图2:真实实验覆盖桌面清理、舀豆、拔插头、叠衣物和双臂交接等任务。
仿真、真机和新本体分三层验证
在LIBERO-Plus上,VLAct总成功率为82.6%,同骨干、同OFT下游头的Qwen3VL-OFT为75.0%。在RoboTwin 2.0的基础设置中,VLAct-OFT在Clean和Random环境分别得到92.5%和90.8%。这些比较使用固定微调协议,主要检验持续预训练配方,而非单独比较模型参数量。
真机部分包含单臂短任务、单臂长任务和双臂协作。论文汇总的三组平均成功率为91.6%、83.1%和72.0%,对应未做VLAct持续预训练的基线为74.7%、50.2%和44.0%。任务数量和场景仍有限,结果说明方法在受控实验台上能迁移,尚不能代表长期无人值守运行。
图3:VLAct在单臂短任务和双臂任务中的逐项成功次数均整体高于同设置基线。
下一步:把数据效率带到更多真机
最强对比来自预训练未见过的GR-1人形本体。VLAct使用10%、20%、50%和100%下游轨迹时,成功率依次为41.42%、49.5%、51.0%和54.0%。GR00T-N1.6用全量数据为47.6%,Qwen3VL-OFT为48.8%,因此20%这个点确实越过了两项全量数据报告值。
图4:RoboCasa-GR1上,VLAct用20%下游轨迹达到49.5%,超过两项全量数据基线。
下一步要看同样的数据效率能否在更多真实本体、更多传感器和更长任务链上复现。对机器人团队而言,可检验的产品化方向不是“完全不要采数据”,而是把一套骨干迁移到新机械臂或人形平台时,减少重新采集和微调的轨迹量,并继续测量真机故障率、恢复能力和长期稳定性。
尤其需要统一统计每种本体的采集小时数、失败轨迹和人工接管次数,才能把“20%数据”换算成可比较的工程成本。
参考资料
https://arxiv.org/abs/2608.27550
https://arxiv.org/html/2608.27550