CoinVE-200K:用于组合式指令引导视频编辑的大规模高质量数据集
CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
August 18, 2026
作者: Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou, Yan Li, Xiao Cao, Xinlong Sun, Xi Chen, Yu Liu
cs.AI
摘要
基於指令的影片編輯資料集的品質與多樣性持續提升,然而現有資料集主要聚焦於單一編輯操作,難以支援組合式指令引導的影片編輯。具體而言,多重編輯意圖必須在同一影片中被聯合理解並忠實執行。為了解決此問題,我們提出了CoinVE-200K,一個大規模、高品質的組合式指令引導影片編輯資料集。CoinVE-200K包含多達201幀的1080p影片-編輯對,涵蓋多樣化的組合式場景,其中每個樣本涉及2至5個原子編輯操作。指令針對人物、物體與背景,並涵蓋新增、移除、修改與風格化等編輯類型。所有樣本皆透過精心設計的生成與篩選流程建構,以確保指令忠實度、視覺品質、時間一致性與組合多樣性。我們亦提出了CoinVE-Bench,一個涵蓋多樣主題、操作類型與指令複雜度的組合式指令影片編輯基準。此外,我們提出了CoinVE-Edit,一個基於Wan2.1-T2V-14B與Qwen3-VL-8B-Instruct所建構的220億參數組合式影片編輯模型。CoinVE-Edit將不同編輯指令的區域感知注意力予以解耦,能夠在保留無關內容與時間連貫性的同時,實現精確的多區域編輯。在CoinVE-Bench上的實驗結果顯示,CoinVE-Edit在指令遵循、組合式編輯準確度、視覺品質與時間一致性方面均展現出優異表現。
English
The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.