ChatPaper.aiChatPaper

MultiRef-Compass: Naar een alomvattende evaluatie van multireferentie-naar-audio-videogeneratie

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

July 15, 2026
Auteurs: Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li
cs.AI

Samenvatting

Multi-referentie-naar-audio-video (MR2AV) generatie heeft als doel coherente audio-video-inhoud te genereren op basis van meerdere referenties en tekstuele instructies. Bestaande benchmarks richten zich voornamelijk op tekstgestuurde generatie, behoud van enkele referentiesubjecten of geïsoleerde audio-video-afstemming, waardoor de opkomende MR2AV-setting grotendeels onontgonnen blijft. In vergelijking met deze settings vereist MR2AV dat modellen gezamenlijk redeneren over meerdere referenties terwijl ze gesynchroniseerde visuele en audio-inhoud genereren. Modellen moeten niet alleen elke referentie getrouw behouden, maar ook correct meerdere gerefereerde entiteiten binden en samenstellen tot coherente audiovisuele gebeurtenissen. Om deze leemte aan te pakken introduceren we MultiRef-Compass, een uniforme benchmark voor MR2AV-generatie. Deze omvat 350 zorgvuldig samengestelde voorbeelden, opgesteld via een schaalbare en controleerbare asset-compositiepijplijn, die multi-view subjectbehoud, multi-entiteitbinding en mens-object-scènecompositie dekt. Om interpreteerbare evaluatie te bieden, definieert MultiRef-Compass een evaluatieprotocol met vier dimensies: Basiskwaliteit, Referentieconsistentie, Audio-Video-consistentie en Instructievolging, met behulp van 14 submetrieken. MultiRef-Compass integreert automatische metrieken met een herbeoordelingsverbeterd MLLM-as-a-Judge-raamwerk, wat schaalbare en controleerbare evaluatie mogelijk maakt van zowel perceptuele getrouwheid als referentiegestuurde compositie. Uitgebreide experimenten op acht representatieve MR2AV-systemen onthullen aanzienlijke ruimte voor verbetering op meerdere evaluatiedimensies, wat de noodzaak van een uitgebreide benchmark benadrukt en MultiRef-Compass positioneert als basis voor toekomstig MR2AV-onderzoek.
English
Multi-reference-to-audio-video (MR2AV) generation aims to generate coherent audio-video content conditioned on multiple references and textual instructions. Existing benchmarks mainly focus on text-driven generation, single-reference subject preservation, or isolated audio-video alignment, leaving the emerging MR2AV setting largely unexplored. Compared with these settings, MR2AV requires models to jointly reason over multiple references while generating synchronized visual and audio content. Models must not only preserve each reference faithfully but also correctly bind and compose multiple referenced entities into coherent audio-visual events. To address this gap, we introduce MultiRef-Compass, a unified benchmark for MR2AV generation. It comprises 350 carefully curated samples constructed through a scalable and controllable asset-composition pipeline, covering multi-view subject preservation, multi-entity binding, and human-object-scene composition. To provide interpretable assessment, MultiRef-Compass defines an evaluation protocol with four dimensions: Basic Quality, Reference Consistency, Audio-Visual Consistency, and Instruction Following, using 14 sub-metrics. MultiRef-Compass integrates automatic metrics with a rejudging-enhanced MLLM-as-a-Judge framework, enabling scalable and auditable evaluation of both perceptual fidelity and reference-conditioned composition. Extensive experiments on eight representative MR2AV systems reveal substantial room for improvement across multiple evaluation dimensions, underscoring the need for a comprehensive benchmark and positioning MultiRef-Compass as a foundation for future MR2AV research.