VEFX-Bench : Un Benchmark Holistique pour l'Édition Vidéo Générique et les Effets Visuels
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
April 17, 2026
Auteurs: Xiangbo Gao, Sicong Jiang, Bangya Liu, Xinghao Chen, Minglai Yang, Siyuan Yang, Mingyang Wu, Jiongze Yu, Qi Zheng, Haozhi Wang, Jiayi Zhang, Jared Yang, Jie Yang, Zihan Wang, Qing Yin, Zhengzhong Tu
cs.AI
Résumé
Alors que la création vidéo assistée par l'IA devient de plus en plus pratique, l'édition vidéo guidée par instructions s'avère essentielle pour perfectionner les séquences générées ou capturées afin de répondre aux exigences professionnelles. Pourtant, ce domaine manque encore à la fois d'un jeu de données à grande échelle annoté manuellement avec des exemples d'édition complets et d'un évaluateur standardisé pour comparer les systèmes d'édition. Les ressources existantes sont limitées par leur petite taille, l'absence de sorties éditées ou le manque d'annotations humaines sur la qualité, tandis que l'évaluation actuelle repose souvent sur une inspection manuelle coûteuse ou sur des modèles génériques vision-langue non spécialisés dans la qualité de l'édition. Nous présentons VEFX-Dataset, un jeu de données annoté manuellement contenant 5 049 exemples d'édition vidéo couvrant 9 catégories principales et 32 sous-catégories, chacun étant annoté selon trois dimensions découplées : Respect des Instructions, Qualité du Rendu et Exclusivité de la Modification. Sur la base de VEFX-Dataset, nous proposons VEFX-Reward, un modèle de récompense conçu spécifiquement pour l'évaluation de la qualité de l'édition vidéo. VEFX-Reward traite conjointement la vidéo source, l'instruction d'édition et la vidéo éditée, et prédit des scores de qualité par dimension via une régression ordinale. Nous publions également VEFX-Bench, un benchmark de 300 paires vidéo-instruc-tion soigneusement sélectionnées pour la comparaison standardisée des systèmes d'édition. Les expériences montrent que VEFX-Reward s'aligne plus étroitement avec les jugements humains que les évaluateurs VLM génériques et les modèles de récompense antérieurs, tant sur les métriques IQA/VQA standard que sur l'évaluation des préférences par groupe. En utilisant VEFX-Reward comme évaluateur, nous comparons des systèmes d'édition vidéo commerciaux et open-source représentatifs, révélant un écart persistant entre la plausibilité visuelle, le respect des instructions et la localité des modifications dans les modèles actuels.
English
As AI-assisted video creation becomes increasingly practical, instruction-guided video editing has become essential for refining generated or captured footage to meet professional requirements. Yet the field still lacks both a large-scale human-annotated dataset with complete editing examples and a standardized evaluator for comparing editing systems. Existing resources are limited by small scale, missing edited outputs, or the absence of human quality labels, while current evaluation often relies on expensive manual inspection or generic vision-language model judges that are not specialized for editing quality. We introduce VEFX-Dataset, a human-annotated dataset containing 5,049 video editing examples across 9 major editing categories and 32 subcategories, each labeled along three decoupled dimensions: Instruction Following, Rendering Quality, and Edit Exclusivity. Building on VEFX-Dataset, we propose VEFX-Reward, a reward model designed specifically for video editing quality assessment. VEFX-Reward jointly processes the source video, the editing instruction, and the edited video, and predicts per-dimension quality scores via ordinal regression. We further release VEFX-Bench, a benchmark of 300 curated video-prompt pairs for standardized comparison of editing systems. Experiments show that VEFX-Reward aligns more strongly with human judgments than generic VLM judges and prior reward models on both standard IQA/VQA metrics and group-wise preference evaluation. Using VEFX-Reward as an evaluator, we benchmark representative commercial and open-source video editing systems, revealing a persistent gap between visual plausibility, instruction following, and edit locality in current models.