KeyFrame-Compass : Vers une évaluation exhaustive de la génération de vidéo conditionnée par images clés
KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
July 15, 2026
Auteurs: Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang
cs.AI
Résumé
La génération vidéo repose de plus en plus sur des workflows basés sur les images clés, où les créateurs spécifient une séquence d'images de référence pour guider la génération. Bien que les modèles récents supportent le conditionnement multi-images clés, il reste incertain qu'ils puissent reproduire fidèlement les images clés prescrites tout en maintenant la qualité vidéo globale. Nous présentons KeyFrame-Compass, le premier benchmark complet pour évaluer la génération vidéo conditionnée par images clés. Ce benchmark contient 386 échantillons soigneusement sélectionnés couvrant trois domaines d'application, deux structures vidéo, deux granularités de prompt, deux formats de conditionnement et quatre densités d'images clés, permettant une analyse contrôlée sous divers paramètres de génération. Nous introduisons en outre un cadre d'évaluation automatisé qui mesure conjointement l'exécution des images clés et la qualité vidéo globale. Spécifiquement, nous décomposons l'exécution des images clés en six métriques complémentaires couvrant la présence, la fidélité, l'ordre temporel, la localisation, la persistance et l'unicité, tout en évaluant la qualité vidéo globale via des jugements MLLM fondés sur des preuves, augmentés de modèles de perception spécialisés. Les expériences sur neuf systèmes représentatifs de génération vidéo révèlent plusieurs limitations fondamentales. Les modèles actuels présentent un compromis clair entre l'exécution fidèle des images clés et la synthèse vidéo naturelle. Leur performance se dégrade davantage à mesure que les contraintes d'images clés deviennent plus denses, et la plupart des modèles open-source échouent également à interpréter les entrées de grille de storyboard comme des séquences d'images clés ordonnées temporellement.
English
Video generation increasingly relies on keyframe-based workflows, where creators specify a sequence of reference images to guide generation. Although recent models support multi-keyframe conditioning, it remains unclear whether they can faithfully reproduce the prescribed keyframes while maintaining overall video quality. We present KeyFrame-Compass, the first comprehensive benchmark for evaluating keyframe-conditioned video generation. The benchmark contains 386 carefully curated samples spanning three application domains, two video structures, two prompt granularities, two conditioning formats, and four keyframe densities, enabling controlled analysis under diverse generation settings. We further introduce an automated evaluation framework that jointly measures keyframe execution and overall video quality. Specifically, we decompose keyframe execution into six complementary metrics covering presence, fidelity, temporal ordering, localization, persistence, and uniqueness, while assessing overall video quality through evidence-grounded MLLM judgments augmented with specialized perception models. Experiments on nine representative video generation systems reveal several fundamental limitations. Current models exhibit a clear trade-off between faithful keyframe execution and natural video synthesis. Their performance further degrades as keyframe constraints become denser and most open-source models also fail to interpret storyboard-grid inputs as temporally ordered keyframe sequences.