浙江大学、上海交通大学和上海创新研究院等团队提出Track4Action,把机器人演示视频中的3D场景变化变成训练监督。传统模仿学习通常只学习“下一步执行什么命令”,动作让物体、遮挡和相机视角发生了什么变化,并没有被直接写进标签;新方法在四项实体双臂任务上取得67.5%的平均成功率,比去掉这项监督的版本高25个百分点。
论文图1:3D跟踪器描述场景如何变化,VLA策略负责理解任务并输出动作。
冻结跟踪器只在训练期当老师
训练时,冻结的Track4World读取与一段动作对齐的视频片段,提取场景、运动和相机变化特征。VLA模型只看当前观测,通过可学习查询预测这份特征,再把结果送进动作生成头。
论文图2:未来视频片段只用于构造训练目标,部署路径仍只接收当前观测。
这是一种“特权监督”:老师在训练时能看到动作发生后的画面,学生部署时看不到。完成训练后,视频片段和3D跟踪器都被移除,因此不会在机器人实际运行时增加同一套跟踪计算。
仿真成绩提升,实体任务每项只测10次
Track4Action在零样本LIBERO-Plus上达到82.3%,比无对齐版本高7.6个百分点,比论文中的LaMP高3.0个百分点。在RoboTwin 2.0的干净与随机划分上,成功率分别为80.44%和81.48%。
论文图3:双臂平台完成硬物转移、柔性物体操作和长流程交互,并测试颜色、布局与背景变化。
实体实验包含四项双臂任务,每项进行10次。Track4Action平均成功率67.5%,无3D对齐版本为42.5%。优势主要说明训练时加入场景变化监督有效,40次试验仍不足以证明它能覆盖更多机械臂、物体和开放环境。
论文图4:四项任务各10次试验,Track4Action平均完成率为67.5%。
结果把监督重点从动作移到后果
VLA训练数据已经包含演示视频,但常见训练目标主要监督动作序列。Track4Action重新利用同一段视频,要求策略同时预测动作造成的3D后果。它没有在部署时增加未来帧输入,也没有宣称机器人能显式生成完整世界模型。
下一步需要观察两类数据:跨机器人硬件时是否仍有增益,以及长任务里误差连续累积后,3D对齐能否继续稳定。当前论文给出的证据集中在标准仿真基准和四项受控双臂操作。