论文导读
伊利诺伊大学厄巴纳-香槟分校、Adobe研究院联合提出“替换记忆”实验,检查视频模型到底从历史帧拿走了什么。WorldMem中,来自同一轨迹但地点错误的记忆仍保留相对零内容参考94.1%的PSNR收益;这说明收益可能来自运动和场景先验,但结论针对特定模型与数据,不能概括所有视频记忆系统。
关掉记忆掉分,不等于模型记对了
很多视频模型保存过去帧的特征,用来预测遮挡后的物体或未来画面。常见验证方式是把记忆模块关掉:性能下降,就说模型依赖记忆。但这种实验没有回答一个更细的问题——模型需要的是“那个地点的准确内容”,还是只需要来自同一视频的运动、纹理和场景提示?
团队设计了记忆替换审计。它先保留当前查询不变,再把历史记忆换成不同来源:正确地点、同一轨迹的错误地点、同一场景平均内容、其他轨迹,或者完全不给内容。比较输出变化,就能逐层拆开模型依赖的信息。
论文图:查询帧保持不变,只替换记忆库中的内容,用预测差异判断模型真正利用了什么。
错误记忆也能提供有用的先验
如果模型真的记住了具体位置,换成错误地点后表现应该接近无记忆。但结果并非如此。同一轨迹的错误记忆往往仍能带回大量收益,说明记忆可能传递了目标外观、运动方式、场景结构或模型熟悉的统计模式。
论文把这些条件放在统一的“收益恢复比例”下比较。正确记忆设为100%,零内容作为参照,其他替换条件显示它们保留了多少原本由记忆带来的改善。这样比只看最终分数更容易解释模型行为。
论文图:正确、错误轨迹、场景平均与零内容等条件恢复的相对收益并不相同。
94.1%说明记住轨迹,不一定记住地点
在WorldMem的一项SAM2-MOSEv2设置中,同一轨迹但地点错误的记忆恢复了相对零内容参考94.1%的PSNR收益;跨轨迹错误来源仅为43.7%,场景平均内容为62.3%。差距表明“来自哪条轨迹”比“是否正好来自正确地点”更重要。
论文表图:正确记忆为100%,同轨迹错误地点恢复94.1%,场景平均与跨轨迹错误来源更低。
这不是说错误记忆普遍更好,也不是说模型不需要历史。它说明当前记忆模块的性能提升混合了精确回忆和宽泛先验。不同模型、数据集和指标下比例会变化,94.1%只对应论文报告的具体设置。
下一步要测记忆内容,而不只测记忆开关
这套审计可用于视频分割、世界模型和长视频代理。研发团队可以把记忆替换加入评测,检查系统在遮挡、场景切换和长时间间隔后依赖的是哪类信息,再决定是否需要更精确的存储与检索。
后续还应测试对抗性错误记忆、时间顺序打乱和跨对象污染,并观察模型能否主动拒绝不可信历史。真正可靠的视频记忆,不只是“有记忆时分数更高”,还应知道这段记忆是否与当前问题匹配。