KeyFrame-Compass: Zu einer umfassenden Evaluierung der Keyframe-bedingten Videogenerierung
KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation
July 15, 2026
Autoren: Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang
cs.AI
Zusammenfassung
Die Videogenerierung stützt sich zunehmend auf keyframe-basierte Arbeitsabläufe, bei denen Ersteller eine Folge von Referenzbildern vorgeben, um die Generierung zu steuern. Obwohl neuere Modelle eine Multi-Keyframe-Konditionierung unterstützen, ist unklar, ob sie die vorgegebenen Keyframes originalgetreu reproduzieren können, während die Gesamtvideoqualität erhalten bleibt. Wir stellen KeyFrame-Compass vor, die erste umfassende Benchmark zur Bewertung keyframe-konditionierter Videogenerierung. Die Benchmark enthält 386 sorgfältig kuratierte Stichproben, die sich über drei Anwendungsdomänen, zwei Videostrukturen, zwei Prompt-Granularitäten, zwei Konditionierungsformate und vier Keyframe-Dichten erstrecken, was eine kontrollierte Analyse unter verschiedenen Generierungseinstellungen ermöglicht. Wir führen ferner einen automatisierten Bewertungsrahmen ein, der gemeinsam die Keyframe-Umsetzung und die Gesamtvideoqualität misst. Insbesondere zerlegen wir die Keyframe-Umsetzung in sechs komplementäre Metriken, die Präsenz, Genauigkeit, zeitliche Reihenfolge, Lokalisierung, Beständigkeit und Einzigartigkeit abdecken, während die Gesamtvideoqualität durch evidenzbasierte MLLM-Urteile bewertet wird, die durch spezialisierte Wahrnehmungsmodelle ergänzt werden. Experimente mit neun repräsentativen Videogenerierungssystemen zeigen mehrere grundlegende Einschränkungen. Aktuelle Modelle zeigen einen klaren Zielkonflikt zwischen originalgetreuer Keyframe-Umsetzung und natürlicher Videosynthese. Ihre Leistung verschlechtert sich weiter, wenn die Keyframe-Beschränkungen dichter werden, und die meisten Open-Source-Modelle sind auch nicht in der Lage, Storyboard-Gitter-Eingaben als zeitlich geordnete Keyframe-Sequenzen zu interpretieren.
English
Video generation increasingly relies on keyframe-based workflows, where creators specify a sequence of reference images to guide generation. Although recent models support multi-keyframe conditioning, it remains unclear whether they can faithfully reproduce the prescribed keyframes while maintaining overall video quality. We present KeyFrame-Compass, the first comprehensive benchmark for evaluating keyframe-conditioned video generation. The benchmark contains 386 carefully curated samples spanning three application domains, two video structures, two prompt granularities, two conditioning formats, and four keyframe densities, enabling controlled analysis under diverse generation settings. We further introduce an automated evaluation framework that jointly measures keyframe execution and overall video quality. Specifically, we decompose keyframe execution into six complementary metrics covering presence, fidelity, temporal ordering, localization, persistence, and uniqueness, while assessing overall video quality through evidence-grounded MLLM judgments augmented with specialized perception models. Experiments on nine representative video generation systems reveal several fundamental limitations. Current models exhibit a clear trade-off between faithful keyframe execution and natural video synthesis. Their performance further degrades as keyframe constraints become denser and most open-source models also fail to interpret storyboard-grid inputs as temporally ordered keyframe sequences.