arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

视频拍两分钟也不换主角?Custom Forcing免训练锁定参考对象

作者:arXivDaily编辑部 arXiv 2610.02914 cs · cs.CV

论文导读

庆熙大学、得克萨斯大学奥斯汀分校等机构提出Custom Forcing,把参考图直接放进视频模型的长期缓存,生成特定对象时无需为它单独训练。两分钟视频中,主角相似度指标维持在约0.58至0.62。方法根据身份漂移程度加强参考信息,让持续生成的画面保留同一个对象。

长视频里的狗,别越拍越像另一只

输入“山顶上站着一只狗”,视频模型能生成一只符合描述的狗。若用户给的是自己指定的一只,毛色、脸部特征和体形就要与参考照片一致,而且不能拍到后面逐渐换成别的狗。

常见定制方法要为每个对象进行额外优化,或一起处理整段视频。持续向后生成的模型则只能利用已经生成的历史,一段确定后再接下一段。参考身份如何留在越来越长的历史中,是Custom Forcing处理的问题。

它保持视频模型的基础权重不变,把参考图和定制开场画面写入持续保存的注意力缓存。后续每段视频都能读取这些锚点,避免只靠最初几帧留下的间接记忆。

图:红色玩偶、白色狗的参考图与两种视频生成输出。

参考信息要随漂移程度调整

固定锚点仍可能失效。视频不断生成,参考对象的特征会变弱,而文字提示倾向于召回这个类别的一般形象。只写入参考图,并不能保证后面的对象始终一致。

方法先观察已完成片段与参考对象的差异。身份偏离得越明显,就加强参考图中对象区域的影响;背景部分不跟着同样放大,减少参考照片背景干扰新场景。

另一个步骤对比读取锚点与屏蔽锚点两种预测,让生成方向更偏向具体参考对象。一个机制处理随时间积累的漂移,另一个削弱文字对通用类别的拉力,二者共同维持身份。

图:参考锚点写入缓存、漂移调节与锚点对比的处理流程。

两分钟保持身份,不把相似度当成功率

论文使用100组样本检查两分钟持续生成。只放固定锚点时,DINO-I对象相似度从前段约0.58下降到末段约0.42;完整方法在各段维持约0.58至0.62。这个指标衡量图像特征的接近程度,不是“人物身份正确率”。

两分钟整段平均DINO-I,固定锚点为0.501,完整方法为0.623。运动程度指标分别为0.47和0.45,作者据此检查身份增强是否只是把画面冻结。定性图还展示了对象特征随生成时间变化的对照。

在单张H100上,30秒视频比较中的每帧生成耗时,Custom Forcing比所列因果长视频基线快9.5至28.5倍。基线模型大小和实现不同,这组相对耗时不能外推成所有视频产品的统一加速倍数。

图:两分钟生成中完整方法与固定锚点的对象相似度曲线。

下一步:给流式生成增加可持续的对象条件

方法的实际用途是把参考对象条件接进持续生成流程,减少每换一个对象都重新训练的需求。项目演示提供了参考图、文字提示和输出视频,可以并排检查外观是否维持、动作是否继续变化。

后续需要检验更复杂交互、更明显的遮挡和更长时间中的一致性。这里的“免训练”指对象定制阶段保持基础模型不变,并不表示视频模型本身无需训练,也不代表演示已经成为可用的线上产品。

参考资料

https://arxiv.org/abs/2610.02914

https://arxiv.org/html/2610.02914

https://gustn9609.github.io/custom-forcing/

↑