CoinVE-200K:用于组合式指令引导视频编辑的大规模高质量数据集
CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
浏览论文内容
中文总结 AI 辅助
本文提出用于组合式指令引导视频编辑的大规模高质量数据集CoinVE-200K,构建基准CoinVE-Bench及22B参数模型CoinVE-Edit,在基准测试中表现优异。
中文摘要 AI 辅助
基于指令的视频编辑数据集的质量和多样性正在稳步提升,但现有数据集主要聚焦于单一编辑操作,无法支持组合式指令引导的视频编辑。具体而言,需在同一视频中同时理解并忠实执行多个编辑意图。为解决该问题,本文提出CoinVE-200K,这是一个用于组合式指令引导视频编辑的大规模高质量数据集。CoinVE-200K包含最多201帧的1080p视频-编辑对,涵盖多样的组合场景,每个样本涉及2至5个原子编辑操作。指令针对人物、物体和背景,涵盖添加、移除、修改和风格化等编辑类型。所有样本均通过精心设计的生成与过滤流程构建,以确保指令忠实性、视觉质量、时间一致性和组合多样性。本文还推出CoinVE-Bench,这是一个针对不同主体、操作类型和指令复杂度的组合式指令视频编辑基准。此外,本文提出CoinVE-Edit,这是一个基于Wan2.1-T2V-14B和Qwen3-VL-8B-Instruct构建的22B参数组合式视频编辑模型。CoinVE-Edit针对不同编辑指令解耦了区域感知注意力,可在保留无关内容和时间一致性的同时实现精准的多区域编辑。在CoinVE-Bench上的实验表明,CoinVE-Edit在指令遵循、组合编辑准确率、视觉质量和时间一致性方面表现出色。
英文摘要
The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.
发表机构
- Tencent(腾讯)
机构由 AI 辅助整理,请以论文原文为准。