让视频世界模型模拟“向前走、转弯、再回到原地”,画面经常会悄悄换成另一处。英伟达、普林斯顿大学、多伦多大学与Vector Institute提出WorldTrace,无需重新训练模型,只改推理时的记忆缓存,就能把持续时间从数秒推向分钟尺度;在回访场景的一致性测试中,最高提升19.5%。
生成世界为何走远就忘
交互式视频模型通常把最近生成的帧留在注意力缓存里,以便下一帧继承人物、建筑和视角。但显存有限,旧帧不能无限保留;直接把多帧键值求平均虽然能压缩缓存,却会破坏旋转位置编码中的相位。模型越过训练时见过的时间长度后,时间位置也进入分布外区域,旧记忆即使还在,也未必能被正确读取。
因此,短视频看起来连贯,并不等于模型拥有可回访的世界。镜头沿一条街走几十秒再折返,先前店铺可能消失;从房间A经过B、C后回到A,门窗和家具会被重新“即兴创作”。WorldTrace专门处理这种离开视野后再出现的长期一致性。
循环路线要求模型在经过多个场景后重新生成起点,是比相邻帧连贯更严格的记忆测试。
一层记时间,一层记地点
WorldTrace保留近期帧的原始缓存,同时把更早历史压缩为两类记忆。Field记忆先撤销旋转位置编码,在规范坐标中聚合旧键值,再为虚拟时间槽重新施加位置编码,避免直接平均不同相位。它负责保存随时间缓慢变化的全局背景。
Landmark记忆则在进入新场景时冻结一组代表性键值,相当于给地点留下书签。模型再次回到相似语境时,可以从这些场景入口线索中恢复身份,而不是只依赖已经被压缩的连续历史。两层缓存一层维护时间场,一层保留地点地标,并与最新帧共同参与注意力计算。
方法只作用于推理缓存,不要求重新训练原始视频世界模型。
专门考“出去再回来”
团队提出LoopBench,设计A-B-A、A-B-C-A和A-B-C-D-A等路线。评价不只比较相邻视频帧,而是观察模型返回A时,场景身份、结构和时间演化能否与第一次出现对应。随着中间路程增长,普通缓存和简单压缩方法的误差更容易累积。
实验中,WorldTrace在长度N=48的设置上将时间一致性最高提高15.5%,场景一致性最高提高19.5%。视觉样例里,森林、室内空间和横向移动后的回访更能保持原始布局。它并非让模型复读旧帧:新视角仍继续生成,只是远期内容有了可定位的参照。
两项指标关注不同故障。时间一致性检查同一世界随生成推进是否保持连续,场景一致性则专门比较离开后回到原地的身份与结构。一个模型可以在每几秒内都很平滑,却在回访时生成另一座房子;把二者分开,才能避免短期流畅掩盖长期遗忘。N=48结果也表明,记忆收益会在路线变长时更明显。
缓存容量之外还存在位置编码分布外问题,保留旧键值并不自动等于记得正确。
接下来扩展到更长、更动态的世界
WorldTrace的吸引力在于部署门槛低。已有视频世界模型可以在推理阶段加入这套缓存机制,不必重新收集长视频,也不必承担完整训练成本。对于长镜头漫游、游戏原型和机器人环境预测,能够回到先前地点是构建稳定空间感的重要一步。
论文当前在所选世界模型和LoopBench上验证分钟级回访,提升幅度还需要在更多架构中复现。下一步可以把地标更新机制扩展到门被打开、物体被移动、天气发生变化的动态世界,让记忆既能认出旧地点,也能及时写入新状态。
Field与Landmark都位于推理侧,适合继续接入游戏漫游、机器人环境预测和交互式视频生成。若缓存能够根据任务自动决定哪些地点长期保留、哪些细节及时淘汰,世界模型就能支持更长路线,而不必同步扩大完整历史上下文。