arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

机器人不用生成视频也能预演未来:交大等提出ForeWAM,LIBERO成功率超96%

arXiv 2608.11605 cs.AI

机器人在抓杯子、开抽屉前,如果能预测“动作之后场景会怎样变化”,通常更容易规划下一步。上海交通大学、ACE Robotics和南洋理工大学提出ForeWAM,让动作模型获得未来动态,却不在部署时真正生成未来视频;标准版和加速版在LIBERO上的平均成功率分别达到96.7%和96.9%。

显式世界行动模型会先用视频模型逐步去噪,得到未来画面,再据此生成机器人动作。预测直观可看,但多轮视频扩散带来明显延迟。直接策略模型速度快,却只看当前观测,动作网络没有明确通道读取未来动态。

Future-KV只计算一次未来状态

ForeWAM在当前视觉潜变量后加入一组随机未来槽位,让Video DiT做一次预填充。每一层产生的键和值保存为Future-KV,在动作DiT的多步去噪过程中反复复用。机器人因此能读取预测上下文,而无需把潜在状态解码成一帧帧RGB视频。

显式未来、联合模型、直接策略与ForeWAM四种路线

显式未来、联合模型、直接策略与ForeWAM四种路线。

这一设计把视频模型从“未来画面生成器”改成“动态信息提供者”。Future-KV中可以保留物体即将移动、接触关系变化和任务进度等线索,动作分支直接消费这些特征。只做一次视频DiT预填充,也避免动作去噪每一步都重新计算相同视觉历史。

动态寄存器只在训练时看得到老师

潜在未来如果没有约束,模型可能学到与操作无关的纹理。团队加入dynamics registers,并使用冻结的潜在动作教师监督,让寄存器对交互引起的变化更敏感。真实未来观测和教师模型只在训练阶段出现,部署时既不需要事先知道未来,也不需要携带教师。

ForeWAM的Future-KV、动态寄存器与动作DiT结构

ForeWAM的Future-KV、动态寄存器与动作DiT结构。

训练和部署条件的分离很重要:真实机器人不可能提前拿到下一时刻图像。ForeWAM学习阶段用未来帧校准内部状态,执行阶段根据当前观测形成隐式预测,再让动作生成过程读取这些状态。

动作DiT在去噪的不同层都能访问对应Future-KV,预测信息并非只在输入端拼接一次。物体接触、位移和任务进度可以在生成动作序列时持续发挥作用。加速版进一步减少计算,论文中仍保持与标准版接近的LIBERO平均成功率。

不做具身预训练,LIBERO平均成功率仍超96%

ForeWAM没有使用具身机器人数据预训练。论文报告,标准版在LIBERO平均成功率为96.7%,加速版为96.9%;标准版在更强调分布变化的LIBERO-Plus上取得61.6%。两种版本接近,说明减少计算后没有在标准基准上付出明显成功率代价。

不同注意力与未来状态连接方式的对照

不同注意力与未来状态连接方式的对照。

这些数字来自LIBERO仿真操作基准,不是实体机器人成功率。LIBERO-Plus明显更低的61.6%也显示,场景、物体或视觉分布变化仍会放大策略误差。论文结论应理解为隐式未来在该评测中有效,而非机器人已经具备通用物理预测。

ForeWAM在机器人操作基准上的实验页面

ForeWAM在机器人操作基准上的实验页面。

下一步把隐式未来带到真实机器人

ForeWAM为低延迟控制提供了一条折中路线:保留世界模型的预测信息,但省去人眼可见的视频生成。机械臂抓取、移动操作和需要快速闭环的任务可以先利用Future-KV做动作条件,再按实际控制频率输出指令。

走向实体部署还需要验证摄像头噪声、控制延迟、未见物体和动作失败后的恢复。隐式状态不直接显示画面,也需要额外工具解释模型预期发生了什么。论文已证明“预演未来”不必等同“渲染未来”,后续重点是把速度优势带到真实控制回路。

一条可行的验证方式是同时记录Future-KV探针、机器人动作和真实后续画面,检查内部预测是否抓住接触变化,而非依赖数据集捷径。若隐式未来判断不确定,控制器还可以切换到更保守动作,或调用显式视频预测做二次确认。

实体测试还应把动作成功率与单步推理延迟一起报告,因为低延迟只有在控制频率足够、动作质量不下降时才有实际价值。

参考资料

https://arxiv.org/abs/2608.11605