KeyFrame-Compass: Hacia una Evaluación Integral de la Generación de Video Condicionada por Fotogramas Clave
KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
July 15, 2026
Autores: Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang
cs.AI
Resumen
La generación de videos depende cada vez más de flujos de trabajo basados en fotogramas clave, donde los creadores especifican una secuencia de imágenes de referencia para guiar la generación. Aunque los modelos recientes admiten el condicionamiento con múltiples fotogramas clave, aún no está claro si pueden reproducir fielmente los fotogramas clave prescritos mientras mantienen la calidad general del video. Presentamos KeyFrame-Compass, el primer punto de referencia integral para evaluar la generación de videos condicionada por fotogramas clave. El punto de referencia contiene 386 muestras cuidadosamente seleccionadas que abarcan tres dominios de aplicación, dos estructuras de video, dos granularidades de instrucción, dos formatos de condicionamiento y cuatro densidades de fotogramas clave, lo que permite un análisis controlado bajo diversas configuraciones de generación. Además, introducimos un marco de evaluación automatizado que mide conjuntamente la ejecución de fotogramas clave y la calidad general del video. Específicamente, descomponemos la ejecución de fotogramas clave en seis métricas complementarias que cubren presencia, fidelidad, orden temporal, localización, persistencia y singularidad, mientras evaluamos la calidad general del video mediante juicios de MLLM basados en evidencia y aumentados con modelos de percepción especializados. Los experimentos en nueve sistemas representativos de generación de videos revelan varias limitaciones fundamentales. Los modelos actuales muestran un claro equilibrio entre la ejecución fiel de fotogramas clave y la síntesis natural de video. Su rendimiento se degrada aún más a medida que las restricciones de fotogramas clave se vuelven más densas, y la mayoría de los modelos de código abierto también fallan al interpretar las entradas de cuadrícula de guion gráfico como secuencias de fotogramas clave ordenadas temporalmente.
English
Video generation increasingly relies on keyframe-based workflows, where creators specify a sequence of reference images to guide generation. Although recent models support multi-keyframe conditioning, it remains unclear whether they can faithfully reproduce the prescribed keyframes while maintaining overall video quality. We present KeyFrame-Compass, the first comprehensive benchmark for evaluating keyframe-conditioned video generation. The benchmark contains 386 carefully curated samples spanning three application domains, two video structures, two prompt granularities, two conditioning formats, and four keyframe densities, enabling controlled analysis under diverse generation settings. We further introduce an automated evaluation framework that jointly measures keyframe execution and overall video quality. Specifically, we decompose keyframe execution into six complementary metrics covering presence, fidelity, temporal ordering, localization, persistence, and uniqueness, while assessing overall video quality through evidence-grounded MLLM judgments augmented with specialized perception models. Experiments on nine representative video generation systems reveal several fundamental limitations. Current models exhibit a clear trade-off between faithful keyframe execution and natural video synthesis. Their performance further degrades as keyframe constraints become denser and most open-source models also fail to interpret storyboard-grid inputs as temporally ordered keyframe sequences.