T2AV-Compass: 텍스트-오디오-비디오 생성을 위한 통합 평가 방향
T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
December 24, 2025
저자: Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang, Yuanxing Zhang, Jialu Chen, Miao Deng, Jiahao Wang, Yubin Guo, Chenxi Liao, Yize Zhang, Zhaoxiang Zhang, Jiaheng Liu
cs.AI
초록
텍스트-오디오-비디오(T2AV) 생성은 자연어로부터 시간적으로 일관된 비디오와 의미론적으로 동기화된 오디오를 합성하는 것을 목표로 하지만, 그 평가는 여전히 단일 모달리티 지표에 의존하거나 복잡한 프롬프트 하에서의 교차 모달리티 정렬, 지시문 준수, 지각적 현실감을 제대로 포착하지 못하는 협소한 벤치마크에 의존하는 등 파편화되어 있습니다. 이러한 한계를 해결하기 위해 본 논문은 T2AV 시스템의 포괄적 평가를 위한 통합 벤치마크인 T2AV-Compass를 제안합니다. T2AV-Compass는 의미적 풍부성과 물리적 타당성을 보장하기 위해 분류 체계 기반 파이프라인을 통해 구성된 500개의 다양하고 복잡한 프롬프트로 구성됩니다. 또한 T2AV-Compass는 비디오 품질, 오디오 품질, 교차 모달리티 정렬을 위한 객관적 신호 수준 지표와 지시문 준수 및 현실감 평가를 위한 주관적 MLLM-as-a-Judge 프로토콜을 통합한 이중 수준 평가 프레임워크를 도입합니다. 11개의 대표적인 T2AV 시스템에 대한 광범위한 평가 결과, 가장 강력한 모델들조차 인간 수준의 현실감과 교차 모달리티 일관성에 크게 미치지 못하며, 오디오 현실감, 세밀한 동기화, 지시문 준수 등에서 지속적인 실패를 보였습니다. 이러한 결과는 향후 모델들이 개선해야 할 상당한 여지가 있음을 시사하며, T2AV-Compass가 텍스트-오디오-비디오 생성 기술 발전을 위한 도전적이고 진단적인 테스트베드로서 가치가 있음을 강조합니다.
English
Text-to-Audio-Video (T2AV) generation aims to synthesize temporally coherent video and semantically synchronized audio from natural language, yet its evaluation remains fragmented, often relying on unimodal metrics or narrowly scoped benchmarks that fail to capture cross-modal alignment, instruction following, and perceptual realism under complex prompts. To address this limitation, we present T2AV-Compass, a unified benchmark for comprehensive evaluation of T2AV systems, consisting of 500 diverse and complex prompts constructed via a taxonomy-driven pipeline to ensure semantic richness and physical plausibility. Besides, T2AV-Compass introduces a dual-level evaluation framework that integrates objective signal-level metrics for video quality, audio quality, and cross-modal alignment with a subjective MLLM-as-a-Judge protocol for instruction following and realism assessment. Extensive evaluation of 11 representative T2AVsystems reveals that even the strongest models fall substantially short of human-level realism and cross-modal consistency, with persistent failures in audio realism, fine-grained synchronization, instruction following, etc. These results indicate significant improvement room for future models and highlight the value of T2AV-Compass as a challenging and diagnostic testbed for advancing text-to-audio-video generation.