arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里&港中大深圳等给世界模型整理记忆,删掉83.68%仍记住场景

作者:arXivDaily编辑部 arXiv 2610.02521 cs · cs.CV

论文导读

阿里巴巴、香港中文大学(深圳)、南京大学等机构提出Spatial Memory Intelligence,让理解模型整理世界模型的历史画面。在HY1.5实验中,它删去83.68%的记忆条目,场景一致性评分从51.61提高到67.02。回到之前看过的位置时,模型能够检索更相关的画面,减少场景结构前后对不上的问题。

转回原来的地方,景物不该重新长一遍

用户控制镜头离开房间,再转回来,世界模型需要重现之前的布局。历史画面越积越多,既有重复内容,也有从不同角度看到的同一个区域,只按时间保存,未必容易找到下一步需要的证据。

单靠视野位置检索,可能漏掉被遮住但有用的画面;单靠语义相似度,又可能挑中看起来同类、实际布局不同的场景。SMI增加一个理解画面的模型,让它决定历史该怎样组织和取用。

它管理的是给视频生成器使用的记忆片段,没有声称让基础视频模型本身获得更强的所有生成能力。当前系统用Qwen3.5-4B完成记忆操作,再配合HY1.5或Wan2.2生成画面。

图:已有空间簇与新簇中当前画面和历史画面的对应。

先归到同一空间,再删重复信息

新片段进入后,系统先判断它属于哪个空间区域。相邻时间不等于相邻空间,镜头绕行或反复访问时,同一区域的记录可能散落在时间序列中,先分组才能比较哪些观察重复。

接着,理解模型检查同组画面是否包含新的结构、对象状态或遮挡关系。没有额外信息的记录可以删掉,提供新视角证据的则保留。存下来后,每次检索还结合当前画面与即将执行的动作。

最后一道检查过滤不可靠的生成片段,避免畸变内容成为未来反复引用的“记忆”。整理、删重、检索和过滤协同工作,单独减少条目数量不等于完整方案。

图:记忆分组、删重、检索和可靠性过滤的四步流程。

83.68%指记忆删减,延迟仍有开销

在HY1.5上,记忆条目稀疏率为83.6842%,场景一致性评分从51.6053升到67.0200,往返观察的重建PSNR从12.4785提高到13.3093。Wan2.2实验也检查了相同管理流程,记忆稀疏率为82.2073%。

稀疏率定义为删去的记忆条目占全部条目的比例,不能写成GPU内存减少83.68%。HY1.5的端到端延迟为基础方案的1.38倍,Wan2.2为1.31倍,理解模型带来了额外时间成本。

评测使用100段一分钟视频检查生成表现,另用100段含回访轨迹的视频检查重建一致性。评分包含视频指标、模型评审和用户研究,部分一致性分数来自模型判断,并非现实场景中的任务成功率。

湖边场景对照展示了不同方法回访时的画面,红框标出部分结构差异,供检查数值之外的具体表现。

图:湖边场景多次观察时基础方案和SMI等方法的画面对照。

下一步:理解与生成能否共用一套记忆

实验说明,记忆管理可以在少保留大量重复片段的情况下改善长时间场景一致性。交互式视频和具身模拟可继续测试这一流程,观察重复访问同一地点时结构能否保持。

作者把理解与生成共享表示、联合训练列为后续方向,以减少两套模型之间的开销。当前项目页展示了视频比较,同时将部分模型与数据资源标为后续提供;不能把计划发布的全部资源写成已经完整开放。

参考资料

https://arxiv.org/abs/2610.02521

https://arxiv.org/html/2610.02521

https://spatial-memory-intelligence.github.io/

↑