ChatPaper.aiChatPaper

MultiRef-Compass: Auf dem Weg zu einer umfassenden Bewertung der Multi-Reference-to-Audio-Video-Generierung

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

July 15, 2026
Autoren: Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li
cs.AI

Zusammenfassung

Multi-Referenz-zu-Audio-Video (MR2AV)-Generierung zielt darauf ab, kohärente Audio-Video-Inhalte zu erzeugen, die anhand mehrerer Referenzen und textueller Anweisungen konditioniert sind. Bestehende Benchmarks konzentrieren sich hauptsächlich auf textgesteuerte Generierung, Einzelreferenz-Subjekterhaltung oder isolierte Audio-Video-Abstimmung, sodass das neu aufkommende MR2AV-Setting weitgehend unerforscht bleibt. Im Vergleich zu diesen Settings erfordert MR2AV von Modellen, über mehrere Referenzen hinweg gemeinsam zu schlussfolgern und gleichzeitig synchronisierte visuelle und Audioinhalte zu generieren. Die Modelle müssen nicht nur jede Referenz originalgetreu bewahren, sondern auch mehrere referenzierte Entitäten korrekt binden und zu kohärenten audiovisuellen Ereignissen komponieren. Um diese Lücke zu schließen, stellen wir MultiRef-Compass vor, einen einheitlichen Benchmark für die MR2AV-Generierung. Er umfasst 350 sorgfältig kuratierte Beispiele, die durch eine skalierbare und steuerbare Asset-Kompositionspipeline erstellt wurden und mehransichtige Subjekterhaltung, Multi-Entitätsbindung sowie Mensch-Objekt-Szenen-Komposition abdecken. Zur interpretierbaren Bewertung definiert MultiRef-Compass ein Evaluationsprotokoll mit vier Dimensionen: Grundqualität, Referenzkonsistenz, audiovisuelle Konsistenz und Befolgung von Anweisungen, unter Verwendung von 14 Submetriken. MultiRef-Compass integriert automatische Metriken mit einem durch Nachbewertung verbesserten MLLM-als-Richter-Framework, was eine skalierbare und prüfbare Bewertung sowohl der Wahrnehmungstreue als auch der referenzkonditionierten Komposition ermöglicht. Umfangreiche Experimente an acht repräsentativen MR2AV-Systemen zeigen erheblichen Verbesserungsbedarf in mehreren Evaluationsdimensionen, unterstreichen die Notwendigkeit eines umfassenden Benchmarks und positionieren MultiRef-Compass als Grundlage für zukünftige MR2AV-Forschung.
English
Multi-reference-to-audio-video (MR2AV) generation aims to generate coherent audio-video content conditioned on multiple references and textual instructions. Existing benchmarks mainly focus on text-driven generation, single-reference subject preservation, or isolated audio-video alignment, leaving the emerging MR2AV setting largely unexplored. Compared with these settings, MR2AV requires models to jointly reason over multiple references while generating synchronized visual and audio content. Models must not only preserve each reference faithfully but also correctly bind and compose multiple referenced entities into coherent audio-visual events. To address this gap, we introduce MultiRef-Compass, a unified benchmark for MR2AV generation. It comprises 350 carefully curated samples constructed through a scalable and controllable asset-composition pipeline, covering multi-view subject preservation, multi-entity binding, and human-object-scene composition. To provide interpretable assessment, MultiRef-Compass defines an evaluation protocol with four dimensions: Basic Quality, Reference Consistency, Audio-Visual Consistency, and Instruction Following, using 14 sub-metrics. MultiRef-Compass integrates automatic metrics with a rejudging-enhanced MLLM-as-a-Judge framework, enabling scalable and auditable evaluation of both perceptual fidelity and reference-conditioned composition. Extensive experiments on eight representative MR2AV systems reveal substantial room for improvement across multiple evaluation dimensions, underscoring the need for a comprehensive benchmark and positioning MultiRef-Compass as a foundation for future MR2AV research.