论文导读
南加州大学联合布朗大学、复旦大学、丰田研究院提出Rolling-WAM,让世界动作模型像滚动窗口一样边想象边出动作,不必每次从头算完。它在LIBERO、RoboTin和Unitree G1真机上保持有竞争力的操作表现,稳态重新规划速度提升4.5倍。机器人闭环反应慢的问题有了新解。
每动一下,都要先把未来完整“想”一遍
世界动作模型把“生成动作”和“预测未来画面”耦合在一起,一边想象接下来会看到什么,一边决定该怎么动。这种方式操作能力强,但有个现实的延迟问题:每到一个重新规划节点,都要把整段未来视频和动作从头去噪算完,动作更新被拖慢,闭环响应跟不上环境变化。
对需要快速反应的机器人来说,想太久就会慢半拍。下图是Rolling-WAM的系统总览:人形机器人基于相机观测做滚动推理,右侧评估面板同时列出真机与仿真的成功率和各模式延迟,从头重算的延迟问题在数字上清晰可见。
图:总览图展示从相机观测到滚动推理的完整系统,右侧面板给出真机、仿真成功率与各模式延迟。
交错噪声级的滑动窗口
Rolling-WAM的思路可以理解成一个滑动窗口,窗口里装着多段“视频—动作”块,但每块处在不同的去噪进度上,噪声级别交错。
每走一步,一套滚动噪声调度会把最近、马上要执行的那块完全去噪,直接交付动作;更远的未来块只做部分精化。随着窗口跟着新的相机观测向前推进,之前保留下来的未来块接着继续去噪,不用从零开始。这样计算量被摊到时间轴上,演化中的“视觉—动作”上下文还能跨块延续。
图:框架图展示交错噪声块如何随窗口推进逐块完成去噪并输出动作。
4.5倍提速,操作准头没丢
团队在LIBERO、RoboTin仿真基准和真实Unitree G1人形机器人上评测。结果显示Rolling-WAM取得了有竞争力的操作表现:LIBERO 98.1%、RoboTin 93.3%,G1真机任务85.0%。
效率是核心收益。由于不必每个周期都把整个预测视界从头去噪,稳态下重新规划相比标准联合WAM提速4.5倍——延迟从978毫秒降到215毫秒,单步少等763毫秒。下图是G1真机执行画面,机器人在滚动预测中完成操作任务。
图:Unitree G1人形机器人在真实场景中边滚动预测边执行操作。
未来落地:把“想”和“动”真正并行起来
这项工作对实时机器人控制的意义在于,让高质量世界模型的计算节奏匹配物理执行节奏,而不是让动作停下来等思考。它尤其适合需要持续闭环、对延迟敏感的人形和机械臂场景。
下一步可以研究更长预测视界下的窗口管理、与硬件算力波动相适应的调度,以及把滚动想象扩展到更动态、接触更复杂的任务。随着推理成本继续摊薄,世界模型有望从“离线重算”走向“在线滚动”的实用形态。