MultiRef-Compass : Vers une évaluation exhaustive de la génération audio-vidéo à partir de multiples références
MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
July 15, 2026
Auteurs: Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li
cs.AI
Résumé
La génération multi-référence-à-audio-vidéo (MR2AV) vise à produire un contenu audio-vidéo cohérent conditionné par plusieurs références et instructions textuelles. Les benchmarks existants se concentrent principalement sur la génération pilotée par le texte, la préservation d’un sujet à référence unique, ou l’alignement audio-vidéo isolé, laissant largement inexploré le nouveau cadre MR2AV. Comparé à ces contextes, MR2AV exige que les modèles raisonnent conjointement sur plusieurs références tout en générant un contenu visuel et audio synchronisé. Les modèles doivent non seulement préserver fidèlement chaque référence, mais aussi lier et composer correctement plusieurs entités référencées en événements audio-visuels cohérents. Pour combler cette lacune, nous introduisons MultiRef-Compass, un benchmark unifié pour la génération MR2AV. Il comprend 350 échantillons soigneusement sélectionnés, construits via un pipeline de composition d’actifs scalable et contrôlable, couvrant la préservation de sujets multi-vues, la liaison de multiples entités, et la composition humain-objet-scène. Afin de fournir une évaluation interprétable, MultiRef-Compass définit un protocole d’évaluation avec quatre dimensions : Qualité de base, Cohérence des références, Cohérence audio-visuelle, et Suivi d’instructions, utilisant 14 sous-métriques. MultiRef-Compass intègre des métriques automatiques avec un cadre de juge MLLM assisté par réévaluation, permettant une évaluation scalable et vérifiable de la fidélité perceptuelle et de la composition conditionnée par les références. Des expériences approfondies sur huit systèmes MR2AV représentatifs révèlent une marge d’amélioration substantielle dans plusieurs dimensions d’évaluation, soulignant la nécessité d’un benchmark complet et positionnant MultiRef-Compass comme une fondation pour la recherche future en MR2AV.
English
Multi-reference-to-audio-video (MR2AV) generation aims to generate coherent audio-video content conditioned on multiple references and textual instructions. Existing benchmarks mainly focus on text-driven generation, single-reference subject preservation, or isolated audio-video alignment, leaving the emerging MR2AV setting largely unexplored. Compared with these settings, MR2AV requires models to jointly reason over multiple references while generating synchronized visual and audio content. Models must not only preserve each reference faithfully but also correctly bind and compose multiple referenced entities into coherent audio-visual events. To address this gap, we introduce MultiRef-Compass, a unified benchmark for MR2AV generation. It comprises 350 carefully curated samples constructed through a scalable and controllable asset-composition pipeline, covering multi-view subject preservation, multi-entity binding, and human-object-scene composition. To provide interpretable assessment, MultiRef-Compass defines an evaluation protocol with four dimensions: Basic Quality, Reference Consistency, Audio-Visual Consistency, and Instruction Following, using 14 sub-metrics. MultiRef-Compass integrates automatic metrics with a rejudging-enhanced MLLM-as-a-Judge framework, enabling scalable and auditable evaluation of both perceptual fidelity and reference-conditioned composition. Extensive experiments on eight representative MR2AV systems reveal substantial room for improvement across multiple evaluation dimensions, underscoring the need for a comprehensive benchmark and positioning MultiRef-Compass as a foundation for future MR2AV research.