MuseBench : Évaluation comparative de la compréhension des arts audiovisuels au niveau de l'intention dans les MLLMs
MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs
June 29, 2026
Auteurs: Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon
cs.AI
Résumé
Les arts audiovisuels englobent diverses disciplines créatives, incluant le cinéma, les arts visuels, la performance scénique et la conception de jeux, où le sens artistique émerge de combinaisons délibérées d'éléments visuels, auditifs et narratifs (par exemple, la peur amplifiée par un cadrage claustrophobique, ou le chagrin transmis par le silence et des gros plans prolongés). La véritable compréhension artistique dépasse la simple reconnaissance de ce qui est représenté pour raisonner sur pourquoi cela est exprimé à travers des choix créatifs particuliers. Malgré les progrès importants des modèles de langage multimodaux de grande taille (MLLMs), cet aspect critique de la compréhension artistique reste sous-exploré, car les référentiels existants mesurent principalement la reconnaissance perceptuelle tout en négligeant le raisonnement sur l'intention créative. Pour combler cette lacune, nous présentons Musebench, un référentiel complet conçu pour évaluer les MLLMs sur la compréhension artistique nuancée. Il comprend 4 016 questions couvrant les arts cinématographiques, les arts visuels statiques, les arts de la scène et les arts du jeu, distillées à partir de plus de 10 000 essais vidéo candidats associant commentaires professionnels et démonstration visuelle. Pour capturer la nature ouverte de l'analyse artistique à grande échelle, le référentiel combine des questions à choix unique et des questions à choix multiples à options variables. Toutes les questions sont générées et affinées via un pipeline itératif en quatre phases combinant filtrage des raccourcis, distracteurs adversariaux et validation experte. Une évaluation complète en zero-shot de 28 MLLMs de pointe révèle que même le modèle le plus performant atteint seulement 48,29 % de précision, bien en dessous de la performance d'expert humain de 87,18 %, exposant un écart significatif dans l'expertise du domaine créatif des modèles actuels.
English
Audiovisual arts encompass diverse creative disciplines, including cinema, visual arts, stage performance, and game design, where artistic meaning arises from deliberate combinations of visual, auditory, and narrative elements (e.g., fear amplified through claustrophobic framing, or grief conveyed through silence and lingering close-ups). True artistic understanding extends beyond recognizing what is depicted to reasoning about why it is expressed through particular creative choices. Despite the strong progress of multimodal large language models (MLLMs), this critical aspect of artistic understanding remains underexplored, as existing benchmarks largely measure perceptual recognition while overlooking reasoning about creative intent. To address this gap, we introduce Musebench, a comprehensive benchmark designed to evaluate MLLMs on nuanced artistic understanding. It comprises 4,016 questions spanning cinematic arts, static visual arts, stage performing arts, and game arts, distilled from over 10K candidate video essays that pair professional commentary with visual demonstration. To capture the open-ended nature of artistic analysis at scale, the benchmark combines single-select and variable-option multi-select questions. All questions are generated and refined through a four-phase iterative pipeline combining shortcut filtering, adversarial distractors, and expert validation. Comprehensive zero-shot evaluation of 28 state-of-the-art MLLMs reveals that even the best-performing model achieves only 48.29% accuracy, substantially below human expert performance of 87.18%, exposing a significant gap in current models' creative domain expertise.