论文导读
香港科技大学(广州)、香港中文大学、腾讯和中科大等机构提出FutureWorlds,让机器人同时预测多种未来画面。模型在三组测试中降低预测误差,更准确地跟随机械臂动作。各条预测独立保留历史,让下一帧生成沿用自己的场景状态。
同一个动作,可以先预测几种结果
机器人世界模型接收当前画面、动作和可选的语言指令,预测接下来场景会怎样变化。画面看起来像厨房还不够,机械臂有没有移动、罐子有没有跟着走,都要与给定动作对应。
只用正确视频逐帧训练,模型在推理时会遇到另一种情况:后续输入包含自己刚生成的画面。前面预测错一点,后面的物体位置和姿态就可能继续偏离。
FutureWorlds让模型对相同条件保留多个预测分支。搜索既考虑模型认为可信的结果,也鼓励候选之间有区别,避免几条几乎一样的未来挤在一起,比较时却提供不了新信息。
图:论文图12按五个时间点比较移动绿色罐子的真实记录与不同模型预测,最后一行是FutureWorlds。
每种未来都带着自己的历史
一条分支把罐子移动到左侧,另一条仍让罐子留在原地,后面的生成就不能共用同一套历史。团队为每个候选保留初始场景、状态锚点和最近的预测,分支被重新排序时,记忆也跟着移动。
保留的历史有固定预算,旧内容不会无限堆积。生成新画面与计算训练反馈时使用相同上下文,避免一个候选在生成时看的是自己的过去,打分更新时却换成另一段条件。
训练再把各条预测与记录的视频比较,将相对好坏转成更新信号。真实未来帧用于计算训练奖励,不会提前作为推理输入喂给模型。论文将这套后训练办法称为MemSPO。
图:论文图2展示监督初始化、候选未来搜索、独立记忆与相对奖励后训练的连接关系。
20.84%下降的是视觉预测误差
主测试在RT-1、BridgeV2与RoboCasa上进行,每组固定128条留出轨迹,比较32帧预测。图像按参考分辨率对齐,报告像素、结构与感知差异三类指标。
感知差异指标LPIPS越低越好。FutureWorlds在三组数据上分别得到0.1551、0.1409和0.1833,相比每组该指标表现最好的基线,下降14.78%、20.84%和9.12%。这不是机器人任务成功率提高20.84%,也不是生成画面有20.84%的概率正确。
同样只做200次后训练更新,MemSPO在32帧上的LPIPS低于普通GRPO。团队还比较了光流,也就是画面中物体的运动变化;相对监督微调模型,三组流误差分别下降12.40%、4.57%和16.68%。
图:论文图6左侧比较三组数据的运动指标,右侧用一致色标展示部分光流案例。
下一步要接上规划,也要压低等待时间
保留最近历史的实验显示,长预测不只依赖初始画面。固定模型权重与解码设置,删除历史记忆会显著提高32帧误差;初始锚点在最近历史之外带来较小的额外收益。
模型推理参数约2.57亿。在一张H20上、批量为1的BridgeV2原生配置测量中,峰值分配显存为1.89GiB,但32帧预测的中位耗时为26.76秒,iVideoGPT对应测量为4.14秒。模型较小,搜索多个候选仍然要付出时间。
论文附录展示了利用预测画面为动作选择提供反馈的案例,作者把更快解码与闭环规划、真实机器人控制验证列为后续方向。当前的主要证据仍来自视频预测测试;工程接入还需要同时考察等待时间、动作跟随和预测偏差。
参考资料
https://arxiv.org/abs/2610.01019
https://arxiv.org/html/2610.01019