arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2608.17566cs.CV

CoinVE-200K:用于组合式指令引导视频编辑的大规模高质量数据集

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou, Yan Li, Xiao Cao, Xinlong Sun, Xi Chen, Yu Liu

首次发表
浏览论文内容

中文总结 AI 辅助

本文提出用于组合式指令引导视频编辑的大规模高质量数据集CoinVE-200K,构建基准CoinVE-Bench及22B参数模型CoinVE-Edit,在基准测试中表现优异。

中文摘要 AI 辅助

基于指令的视频编辑数据集的质量和多样性正在稳步提升,但现有数据集主要聚焦于单一编辑操作,无法支持组合式指令引导的视频编辑。具体而言,需在同一视频中同时理解并忠实执行多个编辑意图。为解决该问题,本文提出CoinVE-200K,这是一个用于组合式指令引导视频编辑的大规模高质量数据集。CoinVE-200K包含最多201帧的1080p视频-编辑对,涵盖多样的组合场景,每个样本涉及2至5个原子编辑操作。指令针对人物、物体和背景,涵盖添加、移除、修改和风格化等编辑类型。所有样本均通过精心设计的生成与过滤流程构建,以确保指令忠实性、视觉质量、时间一致性和组合多样性。本文还推出CoinVE-Bench,这是一个针对不同主体、操作类型和指令复杂度的组合式指令视频编辑基准。此外,本文提出CoinVE-Edit,这是一个基于Wan2.1-T2V-14B和Qwen3-VL-8B-Instruct构建的22B参数组合式视频编辑模型。CoinVE-Edit针对不同编辑指令解耦了区域感知注意力,可在保留无关内容和时间一致性的同时实现精准的多区域编辑。在CoinVE-Bench上的实验表明,CoinVE-Edit在指令遵循、组合编辑准确率、视觉质量和时间一致性方面表现出色。

英文摘要

The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.

发表机构

  • Tencent(腾讯)

机构由 AI 辅助整理,请以论文原文为准。

补充信息

相关深度报道

↑