交互式世界模型跟随按键向前走并不难,难的是走远以后再回来,场景还要与起点一致。香港科技大学(广州)、阿里巴巴ATH实验室提出ReWorld,在64秒、384个潜变量的往返轨迹中,只保留固定12个视频块的缓存,仍能恢复开头看到的场景。
ReWorld同时生成704×1280视频,并把采样压到4步。它展示的是作者构造的可进入生成世界,不是带有严格物理状态的通用模拟器;实验重点是动作跟随、长程重访和视频质量。
控制要看近处,记忆要看远处
用户刚按下方向键,下一批画面必须立刻响应,因此控制依赖最近的动作和帧。重访场景却需要很久以前的证据。若所有注意力头都看完整历史,显存会随时间增长;若只用滑动窗口,起点信息很快被挤出。
ReWorld在训练时混合不同注意力窗口:多数头关注近期,一小部分头可以读取更长历史;随机头路由避免“记忆能力”永久绑定到少数固定头。训练还会随机丢掉部分历史区块,让稀疏记忆成为模型见过的输入,而不是部署时突然出现的异常。
论文Figure 1:模型按相机指令移动、离开后返回原场景,并持续生成长轨迹。
用位姿索引地标,缓存不随路程增长
推理阶段,模型用里程变化决定何时写入地标,并按当前相机位姿检索最近的历史视图。完整地标库可以放在主机内存,进入GPU的仍是固定预算下的少量KV块。无论用户走多远,注意力计算规模不会跟着历史线性增长。
论文框架图:多源数据对齐、控制与记忆训练、地标检索和4步流式推理组成完整流程。
为了让不同数据源中的“向前一步”含义接近,团队把虚幻引擎漫游、游戏画面和真实视频等八类来源对齐到统一度量尺度。回文式轨迹先离开再返回,为模型提供同一地点重访的监督信号。
64秒回程测试专门测“有没有忘”
长程实验使用同一轨迹的96、192、288和384个潜变量前缀。全KV方法在更长区间耗尽显存,滑动窗口则已经丢掉早期证据。ReWorld的12块缓存保持不变,在288和384潜变量的远距离重访区间仍保留较高的场景相似度。
这种设计把GPU里的活动上下文与主机端地标库分开。新地标按移动距离写入,检索则依据当前位置挑选邻近视图;数据传输可以预取。固定的是每次送入注意力的块数,不是系统永远只保存12个地点,长时间运行仍要管理主机侧地标数量。
论文长程消融:滑动窗口、KV压缩与ReWorld在离开并返回起点时的画面对比。
动作控制评测中,ReWorld报告11.95°旋转误差,并在相机运动一致性上取得最佳结果。各模型执行路径长度并不完全相同,论文也提示部分基线走得明显更短,因此不能只看一个误差数字就断言全面领先。
视频质量评测把片段归一到32帧、1280×704和16 FPS后比较,属于受控离线测量。项目页的实时演示用于观察连续交互,论文指标则用于比较同一长度的输出;两类证据回答的问题不同。
论文基线对比:相同相机意图下,不同模型在多个时间点的场景与运动保持情况。
从记住画面走向可查询的世界状态
固定预算记忆适合长时间游戏漫游、交互式影视预演和具身智能的数据生成。当前地标以相机位姿和生成画面为主,能重建“看起来像原处”的视图,却没有公开可查询的物体状态、碰撞规则或因果变量。
下一步若要进入训练智能体或实时内容产品,还要验证用户反复折返、多物体变化和更复杂指令下的稳定性,并把视觉记忆扩展成可读写的结构化状态。项目页已经开放大量演示,但代码和模型开放情况仍需以后续页面为准。
地标检索也需要处理“同一位置已经发生变化”的情况。若用户移动过物体、打开门或改变光照,系统不能只取回旧画面;它要区分稳定结构与新状态,并决定何时覆盖、合并或保留多个版本。
参考资料
https://arxiv.org/abs/2608.23565