ChatPaper.aiChatPaper

MuseBench: Evaluación comparativa de la comprensión a nivel de intención de las artes audiovisuales en MLLMs

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

June 29, 2026
Autores: Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon
cs.AI

Resumen

Las artes audiovisuales abarcan diversas disciplinas creativas, como el cine, las artes visuales, las artes escénicas y el diseño de videojuegos, donde el significado artístico surge de combinaciones intencionadas de elementos visuales, auditivos y narrativos (por ejemplo, el miedo amplificado mediante encuadres claustrofóbicos, o la tristeza transmitida a través del silencio y primeros planos prolongados). La verdadera comprensión artística va más allá de reconocer lo representado, implicando un razonamiento sobre por qué se expresa mediante elecciones creativas particulares. A pesar del notable progreso de los modelos multimodales de lenguaje grande (MLLMs), este aspecto crítico de la comprensión artística sigue siendo poco explorado, ya que los puntos de referencia existentes miden principalmente el reconocimiento perceptivo, dejando de lado el razonamiento sobre la intención creativa. Para abordar esta brecha, presentamos Musebench, un punto de referencia integral diseñado para evaluar los MLLMs en la comprensión artística matizada. Comprende 4.016 preguntas que abarcan las artes cinematográficas, las artes visuales estáticas, las artes escénicas y las artes de videojuegos, extraídas de más de 10.000 ensayos en video candidatos que combinan comentarios profesionales con demostraciones visuales. Para capturar la naturaleza abierta del análisis artístico a escala, el punto de referencia combina preguntas de selección única y de selección múltiple con opciones variables. Todas las preguntas se generan y refinan mediante un proceso iterativo de cuatro fases que combina filtrado de atajos, distractores adversariales y validación experta. Una evaluación exhaustiva en modo zero-shot de 28 MLLMs de última generación revela que incluso el modelo con mejor rendimiento alcanza solo un 48,29% de precisión, muy por debajo del rendimiento experto humano del 87,18%, lo que expone una brecha significativa en la experiencia en el dominio creativo de los modelos actuales.
English
Audiovisual arts encompass diverse creative disciplines, including cinema, visual arts, stage performance, and game design, where artistic meaning arises from deliberate combinations of visual, auditory, and narrative elements (e.g., fear amplified through claustrophobic framing, or grief conveyed through silence and lingering close-ups). True artistic understanding extends beyond recognizing what is depicted to reasoning about why it is expressed through particular creative choices. Despite the strong progress of multimodal large language models (MLLMs), this critical aspect of artistic understanding remains underexplored, as existing benchmarks largely measure perceptual recognition while overlooking reasoning about creative intent. To address this gap, we introduce Musebench, a comprehensive benchmark designed to evaluate MLLMs on nuanced artistic understanding. It comprises 4,016 questions spanning cinematic arts, static visual arts, stage performing arts, and game arts, distilled from over 10K candidate video essays that pair professional commentary with visual demonstration. To capture the open-ended nature of artistic analysis at scale, the benchmark combines single-select and variable-option multi-select questions. All questions are generated and refined through a four-phase iterative pipeline combining shortcut filtering, adversarial distractors, and expert validation. Comprehensive zero-shot evaluation of 28 state-of-the-art MLLMs reveals that even the best-performing model achieves only 48.29% accuracy, substantially below human expert performance of 87.18%, exposing a significant gap in current models' creative domain expertise.