论文导读
哈佛大学、新加坡国立大学、麻省理工学院、MIT-IBM Watson AI Lab等机构提出Honeycomb,用六张固定尺寸的空间与时空平面保存长视频场景。实验表明它在记忆占用不随生成时长增长的同时,仍能在WorldScore与RealEstate10K上保持生成质量和重访一致性。
长视频会把记忆越堆越大
视频世界模型要记住房间布局、人物位置和已经出现过的物体,否则镜头绕一圈回来,桌椅可能消失或墙面突然变化。现有方法常把每段RGB画面或隐藏特征继续追加到记忆,生成越久,存储和重复计算越多。Honeycomb希望把记忆容量固定下来,而不是用无限增长的历史换一致性。
图:连续场景展示输入、生成和重访区域中的视觉一致性。
核心表示HexMemory由六张空间与时空平面组成。它不是保存每一帧,而是把场景特征压到不同方向的低秩平面上;新视频块到来时,只处理最新观察并写入这些平面。
扩展场景时只拉伸六张平面
当镜头覆盖更大空间或更长时间,系统先扭曲已有平面以对齐新范围,但不增加平面尺寸。随后用置信度加权池化融合新特征,再通过学习到的残差修正细节。读取器从六张平面取回与当前生成位置相关的特征,作为下一段视频的条件。
图:六张空间及时空平面构成固定大小的场景特征存储。
这种设计固定的是特征存储规模,并不是说整段视频的生成计算量恒定。视频越长仍要生成更多帧;节省的是历史记忆不会线性膨胀,也不用每次重新处理全部过去画面。
回到旧地点仍要认得出来
团队在WorldScore和RealEstate10K上评估画面质量与场景一致性,并专门测试镜头离开后再次访问旧区域。结果显示,Honeycomb在保持固定特征存储的同时,能稳定恢复此前观察过的结构,长序列中的物体和布局更连贯。
图:对比图呈现不同方法再次生成旧区域时的结构保持情况。
项目的重访图把输入片段、再次生成的区域和其他方法放在一起,直观看出门窗、家具与墙体是否保持。它评估的是论文数据和生成路径内的一致性,还不能替代对开放世界复杂运动、多人遮挡和精细文本的长期测试。
未来固定记忆适合交互式世界模型
如果世界模型要支持游戏、机器人仿真或可探索的数字空间,用户可能反复返回同一区域。固定容量使服务端更容易预估显存,六平面也提供明确的读写接口,方便缓存、分片和调试。
下一步可验证更大地图、更长时间跨度和动态物体身份,尤其要统计多次覆盖写入后旧细节何时丢失。把置信度与不确定性暴露给上层Agent,还能让系统在记忆模糊时主动重新观察,而不是编造场景。
参考资料
https://arxiv.org/abs/2609.37690