ChatPaper.aiChatPaper

KeyFrame-Compass: Naar een uitgebreide evaluatie van keyframe-geconditioneerde videogeneratie

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

July 15, 2026
Auteurs: Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang
cs.AI

Samenvatting

Videogeneratie steunt steeds vaker op op keyframes gebaseerde workflows, waarbij makers een reeks referentieafbeeldingen specificeren om de generatie te sturen. Hoewel recente modellen conditionering met meerdere keyframes ondersteunen, blijft het onduidelijk of ze de voorgeschreven keyframes getrouw kunnen reproduceren met behoud van de algehele videokwaliteit. Wij presenteren KeyFrame-Compass, de eerste uitgebreide benchmark voor het evalueren van keyframe-geconditioneerde videogeneratie. De benchmark bevat 386 zorgvuldig samengestelde voorbeelden uit drie toepassingsdomeinen, twee videostructuren, twee granulariteitsniveaus van prompts, twee conditioneringformaten en vier keyframedichtheden, wat gecontroleerde analyse onder uiteenlopende generatie-instellingen mogelijk maakt. Verder introduceren we een geautomatiseerd evaluatiekader dat zowel de uitvoering van keyframes als de algehele videokwaliteit meet. Concreet splitsen we de uitvoering van keyframes op in zes complementaire metrieken die betrekking hebben op aanwezigheid, getrouwheid, temporele ordening, lokalisatie, persistentie en uniciteit, terwijl we de algehele videokwaliteit beoordelen via evidentie-gebaseerde MLLM-oordelen, aangevuld met gespecialiseerde perceptiemodellen. Experimenten met negen representatieve videogeneratiesystemen onthullen verschillende fundamentele beperkingen. Huidige modellen vertonen een duidelijke afweging tussen getrouwe keyframe-uitvoering en natuurlijke videosynthese. Hun prestaties nemen verder af naarmate keyframe-beperkingen dichter worden en de meeste opensource-modellen slagen er ook niet in om storyboard-grid-invoer te interpreteren als temporeel geordende keyframereeksen.
English
Video generation increasingly relies on keyframe-based workflows, where creators specify a sequence of reference images to guide generation. Although recent models support multi-keyframe conditioning, it remains unclear whether they can faithfully reproduce the prescribed keyframes while maintaining overall video quality. We present KeyFrame-Compass, the first comprehensive benchmark for evaluating keyframe-conditioned video generation. The benchmark contains 386 carefully curated samples spanning three application domains, two video structures, two prompt granularities, two conditioning formats, and four keyframe densities, enabling controlled analysis under diverse generation settings. We further introduce an automated evaluation framework that jointly measures keyframe execution and overall video quality. Specifically, we decompose keyframe execution into six complementary metrics covering presence, fidelity, temporal ordering, localization, persistence, and uniqueness, while assessing overall video quality through evidence-grounded MLLM judgments augmented with specialized perception models. Experiments on nine representative video generation systems reveal several fundamental limitations. Current models exhibit a clear trade-off between faithful keyframe execution and natural video synthesis. Their performance further degrades as keyframe constraints become denser and most open-source models also fail to interpret storyboard-grid inputs as temporally ordered keyframe sequences.