ChatPaper.aiChatPaper

MultiRef-Compass: Hacia una evaluación integral de la generación de audio y video a partir de múltiples referencias

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

July 15, 2026
Autores: Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li
cs.AI

Resumen

La generación de audio-video desde múltiples referencias (MR2AV) tiene como objetivo generar contenido audiovisual coherente condicionado por múltiples referencias e instrucciones textuales. Los benchmarks existentes se centran principalmente en la generación guiada por texto, la preservación de sujetos con una sola referencia o la alineación aislada entre audio y video, dejando en gran medida inexplorado el emergente escenario MR2AV. En comparación con estos contextos, MR2AV exige que los modelos razonen de forma conjunta sobre múltiples referencias mientras generan contenido visual y de audio sincronizado. Los modelos no solo deben preservar fielmente cada referencia, sino también vincular y componer correctamente múltiples entidades referenciadas en eventos audiovisuales coherentes. Para abordar esta carencia, presentamos MultiRef-Compass, un benchmark unificado para la generación MR2AV. Comprende 350 muestras cuidadosamente seleccionadas, construidas mediante un pipeline de composición de activos escalable y controlable, que abarca la preservación de sujetos desde múltiples vistas, la vinculación de múltiples entidades y la composición humano-objeto-escena. Para proporcionar una evaluación interpretable, MultiRef-Compass define un protocolo de evaluación con cuatro dimensiones: Calidad Básica, Consistencia con las Referencias, Consistencia Audiovisual y Seguimiento de Instrucciones, mediante 14 sub-métricas. MultiRef-Compass integra métricas automáticas con un marco de MLLM como Juez mejorado con re-evaluación, lo que permite una evaluación escalable y auditable tanto de la fidelidad perceptual como de la composición condicionada por referencias. Experimentos exhaustivos en ocho sistemas MR2AV representativos revelan un margen sustancial de mejora en múltiples dimensiones de evaluación, lo que subraya la necesidad de un benchmark integral y posiciona a MultiRef-Compass como base para futuras investigaciones en MR2AV.
English
Multi-reference-to-audio-video (MR2AV) generation aims to generate coherent audio-video content conditioned on multiple references and textual instructions. Existing benchmarks mainly focus on text-driven generation, single-reference subject preservation, or isolated audio-video alignment, leaving the emerging MR2AV setting largely unexplored. Compared with these settings, MR2AV requires models to jointly reason over multiple references while generating synchronized visual and audio content. Models must not only preserve each reference faithfully but also correctly bind and compose multiple referenced entities into coherent audio-visual events. To address this gap, we introduce MultiRef-Compass, a unified benchmark for MR2AV generation. It comprises 350 carefully curated samples constructed through a scalable and controllable asset-composition pipeline, covering multi-view subject preservation, multi-entity binding, and human-object-scene composition. To provide interpretable assessment, MultiRef-Compass defines an evaluation protocol with four dimensions: Basic Quality, Reference Consistency, Audio-Visual Consistency, and Instruction Following, using 14 sub-metrics. MultiRef-Compass integrates automatic metrics with a rejudging-enhanced MLLM-as-a-Judge framework, enabling scalable and auditable evaluation of both perceptual fidelity and reference-conditioned composition. Extensive experiments on eight representative MR2AV systems reveal substantial room for improvement across multiple evaluation dimensions, underscoring the need for a comprehensive benchmark and positioning MultiRef-Compass as a foundation for future MR2AV research.