CoinVE-200K:大规模高质量组合式指令引导视频编辑数据集
CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
August 18, 2026
作者: Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou, Yan Li, Xiao Cao, Xinlong Sun, Xi Chen, Yu Liu
cs.AI
摘要
基于指令的视频编辑数据集的质量和多样性正在稳步提升,然而现有数据集主要聚焦于单一编辑操作,难以支持组合式指令引导的视频编辑。具体而言,多种编辑意图需要在同一视频中被联合理解并忠实执行。为解决这一问题,我们提出了CoinVE-200K,一个面向组合式指令引导视频编辑的大规模高质量数据集。CoinVE-200K包含多达201帧的1080p视频编辑对,涵盖了多样化的组合场景,其中每个样本包含2至5个原子编辑操作。指令针对人物、物体和背景,覆盖添加、删除、修改和风格化等编辑类型。所有样本均通过精心设计的生成与过滤流程构建,以确保指令忠实度、视觉质量、时间一致性和组合多样性。我们还提出了CoinVE-Bench,一个面向跨不同主体、操作类型和指令复杂度的组合式指令视频编辑基准。此外,我们提出了CoinVE-Edit,一个基于Wan2.1-T2V-14B和Qwen3-VL-8B-Instruct构建的220亿参数组合式视频编辑模型。CoinVE-Edit对不同编辑指令解耦了区域感知注意力,从而在保留无关内容和时间连贯性的同时,实现精确的多区域编辑。在CoinVE-Bench上的实验表明,CoinVE-Edit在指令遵循、组合编辑准确性、视觉质量和时间一致性方面均取得了优异表现。
English
The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.