ChatPaper.aiChatPaper

MuseBench: Avaliação da Compreensão de Artes Audiovisuais em Nível de Intenção em MLLMs

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

June 29, 2026
Autores: Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon
cs.AI

Resumo

As artes audiovisuais abrangem diversas disciplinas criativas, incluindo cinema, artes visuais, artes cênicas e design de jogos, onde o significado artístico surge de combinações deliberadas de elementos visuais, auditivos e narrativos (por exemplo, o medo amplificado por enquadramentos claustrofóbicos, ou a tristeza transmitida por silêncios e close-ups prolongados). A verdadeira compreensão artística vai além de reconhecer o que é representado, estendendo-se ao raciocínio sobre por que é expresso por meio de escolhas criativas específicas. Apesar do forte progresso dos modelos de linguagem grandes multimodais (MLLMs), esse aspecto crucial da compreensão artística permanece subexplorado, uma vez que os benchmarks existentes medem em grande parte o reconhecimento perceptivo, negligenciando o raciocínio sobre a intenção criativa. Para preencher essa lacuna, apresentamos o Musebench, um benchmark abrangente projetado para avaliar MLLMs na compreensão artística detalhada. Ele compreende 4.016 perguntas que abrangem artes cinematográficas, artes visuais estáticas, artes cênicas e artes de jogos, extraídas de mais de 10 mil videoensaios candidatos que combinam comentários profissionais com demonstrações visuais. Para capturar a natureza aberta da análise artística em grande escala, o benchmark combina perguntas de seleção única e de seleção múltipla com opções variáveis. Todas as perguntas são geradas e refinadas por meio de um pipeline iterativo de quatro fases que combina filtragem de atalhos, distratores adversariais e validação de especialistas. A avaliação zero-shot abrangente de 28 MLLMs de ponta revela que mesmo o modelo com melhor desempenho atinge apenas 48,29% de precisão, substancialmente abaixo do desempenho humano especializado de 87,18%, expondo uma lacuna significativa na expertise de domínio criativo dos modelos atuais.
English
Audiovisual arts encompass diverse creative disciplines, including cinema, visual arts, stage performance, and game design, where artistic meaning arises from deliberate combinations of visual, auditory, and narrative elements (e.g., fear amplified through claustrophobic framing, or grief conveyed through silence and lingering close-ups). True artistic understanding extends beyond recognizing what is depicted to reasoning about why it is expressed through particular creative choices. Despite the strong progress of multimodal large language models (MLLMs), this critical aspect of artistic understanding remains underexplored, as existing benchmarks largely measure perceptual recognition while overlooking reasoning about creative intent. To address this gap, we introduce Musebench, a comprehensive benchmark designed to evaluate MLLMs on nuanced artistic understanding. It comprises 4,016 questions spanning cinematic arts, static visual arts, stage performing arts, and game arts, distilled from over 10K candidate video essays that pair professional commentary with visual demonstration. To capture the open-ended nature of artistic analysis at scale, the benchmark combines single-select and variable-option multi-select questions. All questions are generated and refined through a four-phase iterative pipeline combining shortcut filtering, adversarial distractors, and expert validation. Comprehensive zero-shot evaluation of 28 state-of-the-art MLLMs reveals that even the best-performing model achieves only 48.29% accuracy, substantially below human expert performance of 87.18%, exposing a significant gap in current models' creative domain expertise.