arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频越长,记忆却不涨:哈佛把世界模型塞进6张固定平面

作者:arXivDaily编辑部 arXiv 2609.37690 cs · cs.CV

论文导读

哈佛大学、新加坡国立大学、麻省理工学院、MIT-IBM Watson AI Lab等机构提出Honeycomb,用六张固定尺寸的空间与时空平面保存长视频场景。实验表明它在记忆占用不随生成时长增长的同时,仍能在WorldScore与RealEstate10K上保持生成质量和重访一致性。

长视频会把记忆越堆越大

视频世界模型要记住房间布局、人物位置和已经出现过的物体,否则镜头绕一圈回来,桌椅可能消失或墙面突然变化。现有方法常把每段RGB画面或隐藏特征继续追加到记忆,生成越久,存储和重复计算越多。Honeycomb希望把记忆容量固定下来,而不是用无限增长的历史换一致性。

图:连续场景展示输入、生成和重访区域中的视觉一致性。

核心表示HexMemory由六张空间与时空平面组成。它不是保存每一帧,而是把场景特征压到不同方向的低秩平面上;新视频块到来时,只处理最新观察并写入这些平面。

扩展场景时只拉伸六张平面

当镜头覆盖更大空间或更长时间,系统先扭曲已有平面以对齐新范围,但不增加平面尺寸。随后用置信度加权池化融合新特征,再通过学习到的残差修正细节。读取器从六张平面取回与当前生成位置相关的特征,作为下一段视频的条件。

图:六张空间及时空平面构成固定大小的场景特征存储。

这种设计固定的是特征存储规模,并不是说整段视频的生成计算量恒定。视频越长仍要生成更多帧;节省的是历史记忆不会线性膨胀,也不用每次重新处理全部过去画面。

回到旧地点仍要认得出来

团队在WorldScore和RealEstate10K上评估画面质量与场景一致性,并专门测试镜头离开后再次访问旧区域。结果显示,Honeycomb在保持固定特征存储的同时,能稳定恢复此前观察过的结构,长序列中的物体和布局更连贯。

图:对比图呈现不同方法再次生成旧区域时的结构保持情况。

项目的重访图把输入片段、再次生成的区域和其他方法放在一起,直观看出门窗、家具与墙体是否保持。它评估的是论文数据和生成路径内的一致性,还不能替代对开放世界复杂运动、多人遮挡和精细文本的长期测试。

未来固定记忆适合交互式世界模型

如果世界模型要支持游戏、机器人仿真或可探索的数字空间,用户可能反复返回同一区域。固定容量使服务端更容易预估显存,六平面也提供明确的读写接口,方便缓存、分片和调试。

下一步可验证更大地图、更长时间跨度和动态物体身份,尤其要统计多次覆盖写入后旧细节何时丢失。把置信度与不确定性暴露给上层Agent,还能让系统在记忆模糊时主动重新观察,而不是编造场景。

参考资料

https://arxiv.org/abs/2609.37690

https://jackswl.github.io/honeycomb/

https://github.com/kaichen-z/honeycomb

↑