论文导读
星动纪元、清华大学、香港科技大学(广州)等机构提出VPP2,先训练模型按操作指令预测后续视频,再把预测能力用于机器人动作学习。14B版本在视频指令跟随测试中平均成功率85%,高于Cosmos3-64B的74%。模型先预测接下来可能出现的画面,再用这些未来信息帮助机器人选择动作。方法保留视频模型的操作泛化能力,为机器人生成动作提供更可靠的未来画面。
未来画面预测错了,动作也会走偏
世界动作模型把视频预测和动作生成放在一起,希望机器人先判断接下来会发生什么,再执行操作。基础视频模型擅长生成画面,却未必准确理解“把指定物体移动到某处”的要求。
另一种问题出现在动作训练阶段。给视频模型直接接上动作组件,可能改变原来学到的预测能力。即使标准任务表现很高,换物体、换空间位置或组合方式,预想的运动仍可能出错。
VPP2先收集多种机器人与人手操作视频,继续训练基础视频模型。数据覆盖单臂、双臂、移动平台、人形机器人和人手,训练重点是操作过程与指令对应,而不只追求画面美观。
图:操作视频描述与事件分段的数据处理(Figure 2)。
把一段操作写具体,再学习下一个事件
研究团队给视频加入详细描述,包括哪个执行部位在动、目标物体在哪里、任务是什么,以及相机视角的变化。这样的记录把模糊的短指令拆成具体事件,减少同一句话对应多种不同运动的情况。
视频模型先学事件级预测,再经过后训练和压缩推理步骤,形成一次前向计算即可预测的视觉规划器。论文展示固定8秒预测跨度,推理约0.1秒;动作专家利用预测的内部表示生成2秒动作片段。
视频与动作采用相对分开的组件,让动作学习使用视频知识时,尽量保留原来对未知操作的预测能力。读者可以把它理解为先训练一个能预演任务的模块,再训练另一个把预演转成机械动作的模块。
图:视频训练、单步预测与动作学习流程(Figure 4)。
14B对上64B,领先的是指定预测测试
视频指令跟随表格把人手和机器人场景分开评价。VPP2分别达到80%和90%,Cosmos3-64B分别为70%和78%,两类平均后相差11个百分点。
这项比较评价生成视频是否正确执行指令,不能写成14B在所有视频能力上超过64B。它也不是机械臂实际操作成功率,视频中完成动作与真实机器人完成动作需要分别测量。
在真实ALOHA平台的指定零样本任务中,论文报告VPP2比最好对照高18.5个百分点。为比较公平,π0.5和FastWAM也在VPP2训练数据涉及的ALOHA数据上适配,FastWAM使用14B版本。
论文展示的操作预测还覆盖擦白板、装箱、盖瓶盖和开抽屉,连续帧用于核对目标物体与动作顺序。
图:擦白板、装箱和开抽屉等操作的预测画面序列(Figure 7)。
进一步的仿真评价在各基准训练协议下进行。LIBERO-Pro总体成功率45.0%,LIBERO-OOD为63.9%;RoboDojo整体成功率29.47%。这些测试难度不同,不能拿标准LIBERO的98.8%概括所有复杂任务。
未来应用:检查机器人预演,增加未知操作测试
VPP2的训练流程让视频预测成为可以单独检查的环节。实际任务失败时,可以先核对模型是否预想了正确目标、方向和事件顺序,再检查动作专家是否把预测转成了正确控制。
作者希望后续世界动作模型研究更重视操作视频的泛化,以及动作学习过程中是否保留了这种能力。现有结果提供了人手视频、机器人视频、零样本实机和挑战性仿真几个不同观察角度。
继续扩展时,需要对未知物体、空间扰动和技能组合分别统计,避免只用熟悉任务成绩判断泛化。论文展示的预测画面与独立成功率,已经能支持这种分环节的核验。
参考资料
https://arxiv.org/abs/2610.10270