arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯发布CoinVE-200K:一条指令同时改人、物和背景,视频最长201帧

arXiv 2608.17566 cs.CV

把人物外套换色、在肩膀上加一只鹦鹉,再替换背景,现有视频编辑数据通常会把三项操作拆成三个样本。腾讯发布CoinVE-200K,把2至5种原子编辑组合进同一条指令,目标同时覆盖人物、物体和背景。

数据集包含20万级1080p视频编辑对,单段最长201帧。编辑原子包括添加、删除、修改和风格化,团队通过生成与筛选流水线检查指令遵循、视觉质量、时间一致性和组合复杂度。它是一套训练与评测资源,数据规模本身不能证明某个模型已经能稳定完成这些编辑。

单一编辑数据教不会多目标协同

单操作数据通常只要求“删除路人”或“把汽车改成红色”。真实创作指令常同时包含多个对象与约束:保留人物身份、替换服装、增加道具、修改背景风格,还要让每一帧都保持一致。模型若只见过单任务,容易完成其中一项后漏掉其余要求。

CoinVE-200K把组合性放到样本定义里。每条指令含2至5个编辑原子,目标可能落在人、物或背景,操作覆盖添加、移除、属性修改与风格化。多个动作共用一个视频输入和一个编辑结果,使模型必须学习指令拆解与联合执行。

组合视频编辑样例

样例展示同一视频中对人物服饰、附加物体和背景进行多项联合修改。

数据保持1080p,并将序列长度扩展到最多201帧。高分辨率增加细节难度,长序列则要求新增物体、服装纹理和场景变化在时间上连续,不能只让单帧看起来正确。

生成之后还要经过多级筛选

大规模编辑对难以完全依靠人工逐帧制作。论文采用生成与过滤流水线构建候选,再从指令忠实度、视觉质量、时间一致性和组合程度筛选。任何一项不合格,都可能让训练把错误对应当成规则。

组合编辑结果

论文案例对照原视频与组合编辑结果,检查多项指令是否同时落实。

指令忠实度关注每个原子操作是否出现;视觉质量检查明显伪影;时间一致性关注物体身份、位置和纹理能否跨帧保持;组合性则防止所谓多操作样本实际只由一个主操作决定。论文还提供数据统计,帮助使用者按帧数、目标与编辑类型分析分布。

编辑掩码把变化区域显式标出来

组合编辑容易误伤无需改变的区域。CoinVE-200K在构建阶段使用编辑掩码标记目标区域,让模型区分“需要生成”与“应该保留”的像素。人物、物体和背景同时修改时,掩码还能帮助评测每项操作是否落在正确位置。

数据构建流水线

流水线从视频和组合指令生成候选编辑对,再按多项质量条件过滤。

掩码并不能解决全部问题。遮挡、镜头运动和物体形变会让区域边界随时间变化;一处编辑还可能合理影响阴影、反射和邻近物体。使用者需要结合视频内容判断掩码是硬约束还是辅助监督。

编辑掩码示意

掩码示意标出不同编辑原子对应的目标区域,保留区域不应被无故改写。

数据集同时开放项目页、数据与代码入口,便于复现统计和构建流程。外部训练仍应核查许可证、人物内容与合成数据偏差,并把训练集和评测视频严格去重。

从数据集走向可控的长视频编辑

CoinVE-200K可以用于训练能拆解复合指令的编辑模型,也能建立逐操作评测:分别计算添加、删除、属性修改和风格化是否成功,再测未编辑区域保持与时间一致性。这样比单一整体分数更容易定位模型漏做哪一步。

下一步应增加真实用户指令、复杂镜头运动和更长视频,并报告组合操作数量增加后的性能曲线。产品端还需要可撤销的分步控制,让用户在五项修改中只重做失败的一项。数据集已经把问题从“一次改一个地方”推进到“多项要求共同成立”,模型能否稳定遵循仍要由独立训练和第三方评测回答。

参考资料

https://arxiv.org/abs/2608.17566

https://coinve200k.github.io

https://huggingface.co/datasets/FireCRT/CoinVE-200K

https://github.com/coinve200k/CoinVE-200K