arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

世界模型只错3.7%为什么还是全盘崩?元环智能&北大等找到三个病根

作者:arXivDaily编辑部 arXiv 2609.39604 cs · cs.AI

论文导读

元环智能、北京大学与清华大学等机构联合用细胞自动机拆解世界模型:单格预测准确率可达96.3%,完整演化成功率却只有18.9%。研究把落差归结为空间局部性、时间局部性和时间稳定性,并用三处信息流修改将对应指标从39.1%、25.8%、42.2%大幅推高。

每一步只错一点,滚动起来也会全盘崩

细胞自动机的规则很简单:下一帧每个格子由邻域与历史决定。它因此适合做“显微镜”,排除真实视频里的材质和语义干扰。实验显示,模型逐格看似很准,一旦把自己的输出不断喂回去,早期小错便改变后续邻域,最终轨迹偏离。单步准确率因此会掩盖世界模型真正需要的长期一致性。

图:论文把空间局部、时间局部和时间稳定性并排展示,柱状数字对应三种信息流修复。

三个病根都指向信息该怎样流

空间局部性要求模型明确保留相邻格子的二维关系,避免展平后让边界两侧错误相邻;时间局部性要求同一格的历史与当前输入绑定;时间稳定性则要求生成按因果顺序提交,避免联合去噪时未来帧互相改写。作者没有更换主干模型,而是分别补二维位置、历史检索和因果冻结,直接检验每条假设。

图:格子序列示意展示模型如何寻找等价历史,并在未匹配时回退到先验规则。

接近100%的修复来自受控任务

空间设置从39.1%升至100%,时间设置从25.8%升至99.9%,稳定性设置从42.2%升至99.9%。这些数字证明信息流设计能造成决定性影响,却不等于开放世界视频也能获得同样提升。细胞自动机规则确定、观测完整,真实视频还包含遮挡、连续物理量和不可观测状态,因果来源更复杂。

图:论文图6比较台球与生命游戏中的联合生成和因果冻结,并给出网络深度与步幅结果。

下一步是把诊断带回复杂世界模型

这项工作更像一套故障定位方法:先用受控系统检查模型是否保存邻域、历史与生成顺序,再进入视频或机器人环境。后续可在含遮挡的小游戏、物理模拟和真实视频上逐级增加难度,并同时报告单步误差、轨迹成功率与错误传播距离,避免再次被平均准确率迷惑。

工程上可以把三项诊断做成训练前的单元测试。若模型连二维邻域都无法稳定保持,就没有必要先扩大视频数据;若短期正确但滚动崩溃,则应检查历史绑定与采样顺序。这样的分层测试比只看一个总分更容易定位改动是否有效。进入开放世界后,还应加入不可观测状态和随机扰动,区分模型是真的学到转移规律,还是依赖固定种子与重复图案。只有从可控规则逐步过渡到复杂环境,接近100%的实验结果才具有更广泛解释力。

参考资料

https://arxiv.org/abs/2609.39604

https://github.com/guoshaoyang-pku/momentum-induction

↑