论文导读
南京大学、清华大学、快手、上海人工智能实验室等机构提出Memory Forcing,为视频生成保留开头、近期和中间事件三类记忆。它让模型在视频继续变长时,还能查到早先发生的内容。在1.3B模型测试中,VBench综合分从5秒的83.88到60秒的83.20,下降0.68分。
人物离开画面,还得记得他是谁
视频往后生成,人物暂时被遮挡或走出画面,回来时脸和衣服却变了。这类问题不能只靠最近几帧处理:最近画面里可能根本没有这个人。Memory Forcing给生成模型保留更早的历史,让后面的帧可以继续查询。
图:每行是一段生成视频的时间序列,展示人物、动物和场景的一致性。
论文的定性序列包括花丛中的人物、离开又返回的小猫,以及街景中的机器人。画面按时间排列,可以观察主体外观和场景布局是否持续一致;这种图片序列支持具体样例观察,整体质量仍需测试统计。
在1.3B模型的VBench测试里,综合分从5秒的83.88到60秒的83.20,下降0.68分。综合分汇总多个维度,不能理解成视频里83.20%的帧没有错误。
把开头、近期和中间事件分开存
模型的历史缓存不能随着视频无限扩大。若只按先进先出丢掉最早内容,开头的人物设定与中间发生的重要事件都会逐渐消失;若全留着,计算和存储又会持续增长。
图:开头、归档、近期三类缓存的写入与淘汰规则。
研究把缓存分成三部分。开头的固定内容放进sink,最近运动放进working,中间历史放进archive。实验配置为3、12和6个潜在帧,潜在帧是模型内部压缩后的时间表示,不等同于视频文件中的普通画面帧。
当近期缓存更新时,系统选择具有区分度的历史进入归档,尽量减少重复内容占位。归档也有容量上限,满了仍要淘汰较早内容。因此它保留的是有限历史,不能声称完整记住整段视频。
不同缓存还需要正确的时间位置。长视频的绝对帧编号会越出训练时见过的范围,团队为不同记忆区重新分配时间索引,让模型能区分开头、近期和中间内容,并保持在训练范围内。
视频拉长,记忆策略也要单独测试
论文用1.3B与5B模型测试,视频时长覆盖5、15、30和60秒,分辨率为832×480、16帧每秒。更大模型在一些定性示例中更自然,但不能将其描述为所有指标必定更好。
图:相同机器人场景下不同方法的时间序列,最下方为Memory Forcing。
消融实验分别改动缓存组织与时间索引,检查增益来自哪里。只有近期缓存时,模型更容易丢掉中间内容;加入归档后,历史事件仍能进入后续生成。索引安排不合适,也会降低读取记忆的效果。
综合分下降小,只对应指定测试。其他测试套件的变化幅度不同,不能把VBench的0.68分直接推广到全部视频质量评估,也不能据此保证任意长视频都不换脸。
机器人对照序列给出了主体与场景漂移的直观例子。有限缓存、归档选择和重新分配时间位置共同参与生成,延长视频时不必把全部旧帧都放进当前窗口。