黎曼动力学发布Matrix-Game 3.5,把交互式世界模型的连续生成拉到分钟级,并支持用户实时控制镜头。系统在Matrix-Game 3.0基础上加入几何感知记忆、静态与动态分离表示,以及两阶段实时蒸馏,目标是让生成世界转身后还能记得来路。
普通视频模型生成的是一段固定镜头,交互式世界模型则要根据用户输入不断产生下一帧。时间一长,墙面位置、道路连接和角色外观容易漂移;相机一转,刚离开视野的物体可能消失。Matrix-Game 3.5把长期空间记忆与实时生成放进同一条链路。
Patch Memory按相机位置找回旧场景
长视频一致性的难点不是保存所有历史帧,而是重新看到某个位置时,找到与当前视角真正相关的旧信息。Patch Memory把过去画面拆成带有三维线索的局部补丁,在相机移动后按几何关系检索,减少把无关纹理硬塞回当前帧的情况。
与它配套的tiled-PRoPE把投影相机条件注入位置编码。两项设计不增加新的可学习记忆参数,而是利用已有特征和相机关系组织检索。模型因此能在离开一个区域后再次返回,并较稳定地恢复原有道路、建筑和室内布局。
图:论文页面渲染的长时序交互样例,展示相机移动与场景召回。
静态建筑和动态角色分开记
世界里有两类变化速度完全不同的对象:地面、房屋等静态几何应长期保持,人物、动物和车辆则会持续运动。若用同一表示处理,模型可能为了追踪角色而扭曲背景,也可能为了锁定背景让人物逐渐僵化或变形。
Matrix-Game 3.5使用静态—动态解耦表示,把场景几何与运动主体分别建模,再在生成时合成。这样既能维持镜头运动下的空间结构,也能尽量保留动态主体的身份。训练语料覆盖Unreal仿真环境、开放世界游戏和互联网视频,让模型同时接触可控相机、游戏运动和真实视觉变化。
图:项目页展示补丁记忆、相机轨迹和几何条件之间的关系。
从双向扩散压到少步因果生成
高质量扩散模型通常需要多次去噪,还会同时参考前后信息,无法直接满足实时交互。团队先用感知流匹配保留双向教师的画面能力,再通过基于自回滚的课程式DMD逐步把它蒸馏为少步因果生成器。模型只依赖已经发生的状态,也能跟上用户操作持续出帧。
论文报告系统在长时场景召回、相机控制、主体一致性、提示驱动生成和开放世界实时互动上取得较强结果。其“分钟级”描述的是连续生成时长,不等于每个场景都有严谨物理规则,也不代表已经具备任务、碰撞与计分完整的成品游戏逻辑。
图:项目页中的渐进式蒸馏流程,从双向扩散模型得到少步实时生成器。
从能观看的片段走向可操控环境
Matrix-Game 3.5适合需要视觉反馈的游戏原型、机器人训练和XR内容探索。相比离线视频,用户可以改变移动方向、镜头和提示,让世界对输入连续响应;相比传统引擎,它尝试从数据中生成视觉和动态,而不是逐个手工搭建资产。
后续需要重点检验控制延迟、长于数分钟的记忆容量,以及动作是否遵守稳定的因果和物理约束。项目已公开代码与基础、蒸馏模型,外部复现可以进一步区分:哪些场景是一致的视觉模拟,哪些已经足以支撑智能体学习和可重复评测。
评测也应把画面质量与可交互性拆开。两段视频在视觉上同样连贯,用户执行相同转向或返回操作时,空间结果却可能不同。固定控制脚本、可重复相机轨迹和长期闭环任务,能检验记忆是否真正参与生成,而不只是模型生成了相似纹理。对机器人用途,还需报告动作与环境反馈之间的时间一致性。
参考资料
https://arxiv.org/abs/2608.29910