论文导读
伊利诺伊大学厄巴纳-香槟分校团队提出EditVid,用一个免训练框架兼容指令驱动和参考主体驱动的视频编辑。它在FiVE上取得78.16 FiVE-Acc,对比免训练基线为58.95,用户研究总体偏好51.8%;优势来自论文选定任务和模型,不能写成所有编辑类型全面领先。
两类视频编辑长期各用一套方法
指令驱动编辑要求模型理解“把天空变成黄昏”之类的文字,参考驱动编辑则要把另一张图中的主体身份带入视频。前者强调语义变化,后者强调跨帧身份,两套系统常使用不同训练和控制模块。局部修改还可能蔓延到背景,长视频中的角色外观也容易逐步漂移。
EditVid在现有视频扩散模型上直接工作,不进行额外训练。它用稀疏因果记忆保存早期关键内容,用基于对应关系的注意力后Token注入维持远距离身份,再用软潜变量混合把改动限制在目标区域。
图:论文预览图展示风格、属性、物体插入、局部修改和主体替换等任务。
稀疏记忆与局部混合各管一种错误
稀疏因果记忆从历史帧中选少量信息,避免每一帧都读取全部过去导致计算量持续增长。对应关系模块寻找当前帧与早期主体的匹配位置,把身份相关Token注入后续注意力,减少脸、动物或物体随时间变化。
软潜变量混合根据编辑区域融合原视频与生成结果。目标区域接受更强修改,背景区域尽量沿用原潜变量,降低整幅画面被提示词意外改写的概率。
图:论文结构图展示记忆、对应Token注入和潜变量混合在采样过程中的位置。
FiVE-Acc从58.95提高到78.16
在FiVE基准上,EditVid取得78.16 FiVE-Acc,作者评测中最好的免训练对比方法为58.95,相差19.21分。它在IVEBench上取得有竞争力的结果;用户研究与七种方法比较后,EditVid获得51.8%的总体偏好。
51.8%接近一半,说明用户并非在所有样例上都选择它。不同编辑类型对文字遵循、身份保持、运动连续和背景保护的权重也不同,单个汇总分不能代替逐任务观察。
图:论文性能图比较多种编辑方法的质量指标与计算开销。
图:论文源码中的结果帧展示参考主体被带入目标视频后的外观。
免训练框架下一步要处理更长视频
统一框架降低了为每类编辑单独训练模型的门槛,适合快速试验新提示和参考主体。更长视频会让记忆选择、遮挡重现和身份细节更难,后续需按时长分别报告连贯性和计算成本。
人物与商品编辑还要保留可核对边界。参考图只提供外观时,系统不应自动添加身份、品牌或真实事件;面向创作工具时,也要让用户看到修改区域和原始帧,便于发现背景被误改。