KeyFrame-Compass: к всесторонней оценке генерации видео, обусловленной ключевыми кадрами
KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
July 15, 2026
Авторы: Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang
cs.AI
Аннотация
Генерация видео всё чаще опирается на подходы, основанные на ключевых кадрах, когда создатели задают последовательность эталонных изображений для управления генерацией. Хотя современные модели поддерживают мультиключевое обусловливание, остаётся неясным, способны ли они точно воспроизводить заданные ключевые кадры, сохраняя при этом общее качество видео. Мы представляем KeyFrame-Compass — первый всеобъемлющий бенчмарк для оценки генерации видео по ключевым кадрам. Бенчмарк содержит 386 тщательно отобранных образцов, охватывающих три области применения, две структуры видео, две степени детализации промптов, два формата обусловливания и четыре плотности ключевых кадров, что позволяет проводить контролируемый анализ в различных условиях генерации. Мы также предлагаем автоматизированную систему оценки, которая совместно измеряет точность воспроизведения ключевых кадров и общее качество видео. В частности, мы разбиваем точность воспроизведения ключевых кадров на шесть взаимодополняющих метрик, охватывающих наличие, верность, временную упорядоченность, локализацию, устойчивость и уникальность, а общее качество видео оцениваем с помощью обоснованных суждений мультимодальных больших языковых моделей (MLLM), дополненных специализированными моделями восприятия. Эксперименты на девяти репрезентативных системах генерации видео выявили ряд фундаментальных ограничений. Современные модели демонстрируют явный компромисс между точным воспроизведением ключевых кадров и естественным синтезом видео. Их производительность дополнительно ухудшается по мере увеличения плотности ограничений по ключевым кадрам, а большинство моделей с открытым исходным кодом также не способны интерпретировать раскадровочные сетки как временно упорядоченные последовательности ключевых кадров.
English
Video generation increasingly relies on keyframe-based workflows, where creators specify a sequence of reference images to guide generation. Although recent models support multi-keyframe conditioning, it remains unclear whether they can faithfully reproduce the prescribed keyframes while maintaining overall video quality. We present KeyFrame-Compass, the first comprehensive benchmark for evaluating keyframe-conditioned video generation. The benchmark contains 386 carefully curated samples spanning three application domains, two video structures, two prompt granularities, two conditioning formats, and four keyframe densities, enabling controlled analysis under diverse generation settings. We further introduce an automated evaluation framework that jointly measures keyframe execution and overall video quality. Specifically, we decompose keyframe execution into six complementary metrics covering presence, fidelity, temporal ordering, localization, persistence, and uniqueness, while assessing overall video quality through evidence-grounded MLLM judgments augmented with specialized perception models. Experiments on nine representative video generation systems reveal several fundamental limitations. Current models exhibit a clear trade-off between faithful keyframe execution and natural video synthesis. Their performance further degrades as keyframe constraints become denser and most open-source models also fail to interpret storyboard-grid inputs as temporally ordered keyframe sequences.