arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

PAPERDAILY REPORTS

视频人物转身回来别换脸!快手等给生成模型留住中间记忆

作者:arXivDaily编辑部 arXiv 2610.11756 cs · cs.CV

论文导读

南京大学、清华大学、快手、上海人工智能实验室等机构提出Memory Forcing,为视频生成保留开头、近期和中间事件三类记忆。它让模型在视频继续变长时,还能查到早先发生的内容。在1.3B模型测试中,VBench综合分从5秒的83.88到60秒的83.20,下降0.68分。

人物离开画面,还得记得他是谁

视频往后生成,人物暂时被遮挡或走出画面,回来时脸和衣服却变了。这类问题不能只靠最近几帧处理:最近画面里可能根本没有这个人。Memory Forcing给生成模型保留更早的历史,让后面的帧可以继续查询。

图:每行是一段生成视频的时间序列,展示人物、动物和场景的一致性。

论文的定性序列包括花丛中的人物、离开又返回的小猫,以及街景中的机器人。画面按时间排列,可以观察主体外观和场景布局是否持续一致;这种图片序列支持具体样例观察,整体质量仍需测试统计。

在1.3B模型的VBench测试里,综合分从5秒的83.88到60秒的83.20,下降0.68分。综合分汇总多个维度,不能理解成视频里83.20%的帧没有错误。

把开头、近期和中间事件分开存

模型的历史缓存不能随着视频无限扩大。若只按先进先出丢掉最早内容,开头的人物设定与中间发生的重要事件都会逐渐消失;若全留着,计算和存储又会持续增长。

图:开头、归档、近期三类缓存的写入与淘汰规则。

研究把缓存分成三部分。开头的固定内容放进sink,最近运动放进working,中间历史放进archive。实验配置为3、12和6个潜在帧,潜在帧是模型内部压缩后的时间表示,不等同于视频文件中的普通画面帧。

当近期缓存更新时,系统选择具有区分度的历史进入归档,尽量减少重复内容占位。归档也有容量上限,满了仍要淘汰较早内容。因此它保留的是有限历史,不能声称完整记住整段视频。

不同缓存还需要正确的时间位置。长视频的绝对帧编号会越出训练时见过的范围,团队为不同记忆区重新分配时间索引,让模型能区分开头、近期和中间内容,并保持在训练范围内。

视频拉长,记忆策略也要单独测试

论文用1.3B与5B模型测试,视频时长覆盖5、15、30和60秒,分辨率为832×480、16帧每秒。更大模型在一些定性示例中更自然,但不能将其描述为所有指标必定更好。

图:相同机器人场景下不同方法的时间序列,最下方为Memory Forcing。

消融实验分别改动缓存组织与时间索引,检查增益来自哪里。只有近期缓存时,模型更容易丢掉中间内容;加入归档后,历史事件仍能进入后续生成。索引安排不合适,也会降低读取记忆的效果。

综合分下降小,只对应指定测试。其他测试套件的变化幅度不同,不能把VBench的0.68分直接推广到全部视频质量评估,也不能据此保证任意长视频都不换脸。

机器人对照序列给出了主体与场景漂移的直观例子。有限缓存、归档选择和重新分配时间位置共同参与生成,延长视频时不必把全部旧帧都放进当前窗口。

参考资料

https://arxiv.org/abs/2610.11756

↑