自回归视频模型按片段向后生成,人物或物体离开镜头几十秒后再出现,颜色、形状和位置很容易变化。斯坦福大学、北京大学、字节跳动等机构提出Ring Forcing,通过环形训练、历史压缩和稀疏位置编码,让模型使用分钟级远距离信息。
论文把长期记忆拆成两件事:物体恒常性要求重新出现的对象保持身份,记忆容量要求模型能访问足够久的历史。只扩大上下文而不会精确取回对象,或只能复制近处对象却看不到远处历史,都不能解决长视频问题。
普通训练很少逼模型检索遥远片段
长视频通常由短视频模型扩展而来。训练窗口内,相邻片段已经提供大量线索,模型可以靠最近几帧完成预测,不必学习从遥远历史找回一个离开画面的对象。生成越长,这种局部策略越容易积累身份漂移。
Ring Forcing把训练序列组织成环,让后段必须与较早片段建立对应,并在保持历史约束与生成多样性之间分配条件。模型由此反复遇到“对象离开后返回”的训练结构,而不是偶然碰到一次。
图1:Ring Forcing把视频反转成环,随机裁剪历史、压缩历史帧并丢弃部分环上下文来训练长时检索。
压缩历史,让固定长度覆盖分钟级时间
直接保存每一帧会让显存和计算随视频长度增长。团队组合不同压缩尺度和扩散时间步,用较少Token表示早期历史,同时保留近期片段的细节。固定序列长度下,有效历史跨度因此扩展到分钟级。
稀疏RoPE让位置编码适配更长且不规则的记忆位置,尽量复用预训练模型已经学到的时空先验。模型不必把整段视频重新编码为同等密度,而是在需要时访问不同年龄的历史。
返回画面要恢复对象,而非复制背景
项目页用披萨盒、冰箱中的西瓜等案例展示物体离开与重新出现。对比图中,返回时需要保持配料分布、物体外观和容器关系。左右帧的相似之处可以作为物体恒常性的直观证据,但不能单独代表整个视频的运动质量。
图2:同一披萨在间隔片段后重新进入画面,用于观察配料与形状是否保持。
图3:冰箱门开合前后,模型需要恢复西瓜的身份、位置和外观。
论文报告Ring Forcing在分钟级连贯性和物体恒常性上超过对比方法。成绩属于研究模型和指定测试集,项目页案例也经过挑选,不能把“分钟级历史”理解为任何提示词都能稳定生成数分钟成片。
多样性与记忆约束需要同时观察
过强的历史约束可能让场景停止变化,过弱则会忘记对象。另一组返回案例显示,模型既要保持目标身份,也要允许视角、光照和动作继续推进;评测需同时报告动态程度与身份一致性。
图4:长间隔返回对比用于检查对象身份是否恢复,同时保留场景推进。
从研究演示扩展到长视频制作
长期记忆适合角色连续叙事、镜头切换后道具复现和可交互世界生成。下一步需要把文本剧情、镜头计划和显式对象状态接入记忆路由,让创作者能指定哪些内容必须保持、哪些内容可以变化。
产品化还要核算分钟级生成的时延、显存和失败重试率。若只展示成功片段,很难判断稳定性;公开长序列、固定提示词和完整失败样本,才能评估这一方法能否进入实际制作流程。
编辑工具也需要显式控制记忆。创作者可能希望角色服装始终一致,却允许天气和布景改变;如果系统把所有历史同等锁定,视频会缺乏进展。把人物、道具、地点分别设定记忆期限,会比单一全局强度更适合实际镜头生产。
不同分辨率与帧率下的有效记忆长度,也应单独报告。