CoinVE-200K: 구성적 지시 기반 비디오 편집을 위한 대규모 고품질 데이터셋
CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
August 18, 2026
저자: Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou, Yan Li, Xiao Cao, Xinlong Sun, Xi Chen, Yu Liu
cs.AI
초록
명령 기반 비디오 편집 데이터셋의 품질과 다양성은 꾸준히 향상되고 있지만, 기존 데이터셋은 주로 단일 편집 연산에 초점을 맞추고 있어 구성적 명령 기반 비디오 편집(compositional instruction-guided video editing)을 지원하는 데 부족함이 있다. 특히, 동일한 비디오 내에서 여러 편집 의도를 공동으로 이해하고 충실히 실행해야 한다. 이 문제를 해결하기 위해, 우리는 구성적 명령 기반 비디오 편집을 위한 대규모 고품질 데이터셋인 CoinVE-200K를 소개한다. CoinVE-200K는 최대 201프레임의 1080p 비디오-편집 쌍을 포함하며, 각 샘플이 2~5개의 원자적 편집 연산을 포함하는 다양한 구성적 시나리오를 다룬다. 명령은 인간, 객체, 배경을 대상으로 하며, 추가, 제거, 수정, 스타일화와 같은 편집 유형을 포함한다. 모든 샘플은 명령 충실성, 시각적 품질, 시간적 일관성, 구성적 다양성을 보장하기 위해 신중하게 설계된 생성 및 필터링 파이프라인을 통해 구축된다. 또한 우리는 다양한 대상, 연산 유형, 명령 복잡성에 걸친 구성적 명령 기반 비디오 편집을 위한 벤치마크인 CoinVE-Bench를 소개한다. 나아가, 우리는 Wan2.1-T2V-14B와 Qwen3-VL-8B-Instruct를 기반으로 구축된 22B 규모의 구성적 비디오 편집 모델인 CoinVE-Edit를 제시한다. CoinVE-Edit는 서로 다른 편집 명령에 대해 영역 인지 어텐션(region-aware attention)을 분리하여, 무관한 콘텐츠와 시간적 일관성을 보존하면서 정밀한 다중 영역 편집을 가능하게 한다. CoinVE-Bench에서의 실험은 CoinVE-Edit가 명령 수행, 구성적 편집 정확도, 시각적 품질, 시간적 일관성 측면에서 우수한 성능을 달성함을 보여준다.
English
The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.