论文导读
香港大学、香港科技大学、普林斯顿大学、加州大学圣迭戈分校提出NowWAM:不再让生成模型预测未来画面,而是在当前画面的去噪过程中直接学动作。它把训练视觉token从784减至392,单步耗时从2.85秒降至1.63秒,同时在LIBERO-Plus上达到87.7%。
机器人为什么要先“想象未来”
图像和视频生成模型已经学到了大量物体、场景和语言条件之间的关系。把这种先验迁移给机器人时,很多方法会让模型根据当前画面生成未来画面,再从未来变化里学动作。直觉上,能看见下一帧,似乎就更容易知道机械臂应该怎么动。
NowWAM的对照实验却发现,以过去画面或未来画面作为生成目标,控制表现相近。只有把训练限定在完全干净的画面端点时,鲁棒性明显下降。起作用的可能不是“未来”本身,而是生成模型遍历不同噪声程度的去噪轨迹。
图:Figure 1对比未来画面用于动作预测、生成联合训练与NowWAM当前画面去噪三种设计。
同一条视觉流,一边去噪一边出动作
NowWAM把当前观测加上不同强度的噪声,再让同一个视觉表示同时完成两件事:恢复当前画面,预测机器人动作。动作模块在整条去噪轨迹上接触到多种视觉状态,而不只是一张干净图。推理时则不需要反复去噪,策略在干净端点一次前向就能输出动作。
图:Figure 2中,当前视觉流沿去噪轨迹进入图像DiT骨干,并分别支持去噪损失和机器人动作损失。
在FLUX2-Klein骨干上,NowWAM在LIBERO-Plus达到87.7%,比未来目标联合训练基线高6.1个点。视觉token数量减半后,步耗时从2.85秒下降到1.63秒,约为1.8倍加速。换成纯文生图的Z-Image骨干,成绩达87.8%,表明控制适配不依赖视频生成或图像编辑骨干。
未来应用:摄像机动了,任务还能继续
论文专门测试了机器人初始位置和摄像机视角变化。在定性轨迹中,Fast-WAM和ImageWAM会出现目标定位或动作执行失败,NowWAM则完成了对应任务。这些画面是评测环境中的代表性轨迹,不是真实工厂的稳定部署结果。
图:Figure 3展示初始位置和摄像机视角扰动下,多种方法执行拿碗、开抽屉等任务的连续帧。
接下来要看的是,这种去噪轨迹能否在真实机器人上保留同样的数据效率和鲁棒性,以及当视觉条件、动作空间和机器人本体同时变化时,是否仍能维持单步推理。
这条路线对机器人开发的吸引力在于,它把生成模型已有的图像先验留了下来,却省掉控制时生成未来画面的成本。若要进入真实应用,还必须补上端到端控制频率、长时间运行稳定性和失败恢复等数据。论文的1.8倍来自特定骨干与token设置,不能直接换算成任意硬件上的部署速度;87.7%和87.8%也都是LIBERO-Plus结果,而非实体机器人成功率。