ChatPaper.aiChatPaper

MuseBench: Бенчмаркинг интенционального понимания аудиовизуального искусства в MLLM

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

June 29, 2026
Авторы: Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon
cs.AI

Аннотация

Аудиовизуальные искусства охватывают разнообразные творческие дисциплины, включая кинематограф, изобразительное искусство, сценическое исполнительство и дизайн игр, где художественный смысл возникает из намеренных комбинаций визуальных, слуховых и нарративных элементов (например, страх, усиленный клаустрофобным кадрированием, или горе, передаваемое через тишину и затяжные крупные планы). Истинное понимание искусства выходит за рамки распознавания того, что изображено, и включает рассуждения о том, почему это выражено через определённые творческие решения. Несмотря на значительный прогресс мультимодальных больших языковых моделей (MLLMs), этот ключевой аспект понимания искусства остаётся малоизученным, поскольку существующие бенчмарки в основном измеряют перцептивное распознавание, упуская рассуждения о творческом намерении. Для устранения этого пробела мы представляем Musebench — всеобъемлющий бенчмарк, предназначенный для оценки MLLMs в тонком понимании искусства. Он включает 4 016 вопросов, охватывающих кинематографическое искусство, статическое визуальное искусство, сценическое исполнительское искусство и игровое искусство, извлечённых из более чем 10 тысяч кандидатских видеоэссе, в которых профессиональный комментарий сочетается с визуальной демонстрацией. Для масштабного отражения открытого характера художественного анализа бенчмарк сочетает вопросы с одним выбором и вопросы с множественным выбором с переменным количеством вариантов. Все вопросы генерируются и уточняются с помощью четырёхфазного итеративного конвейера, объединяющего фильтрацию по сокращённым путям, противостоящие дистракторы и экспертную валидацию. Всесторонняя оценка в режиме zero-shot 28 современных MLLMs показывает, что даже лучшая модель достигает лишь 48,29% точности, что существенно ниже показателей экспертов-людей (87,18%), выявляя значительный разрыв в экспертизе текущих моделей в области творчества.
English
Audiovisual arts encompass diverse creative disciplines, including cinema, visual arts, stage performance, and game design, where artistic meaning arises from deliberate combinations of visual, auditory, and narrative elements (e.g., fear amplified through claustrophobic framing, or grief conveyed through silence and lingering close-ups). True artistic understanding extends beyond recognizing what is depicted to reasoning about why it is expressed through particular creative choices. Despite the strong progress of multimodal large language models (MLLMs), this critical aspect of artistic understanding remains underexplored, as existing benchmarks largely measure perceptual recognition while overlooking reasoning about creative intent. To address this gap, we introduce Musebench, a comprehensive benchmark designed to evaluate MLLMs on nuanced artistic understanding. It comprises 4,016 questions spanning cinematic arts, static visual arts, stage performing arts, and game arts, distilled from over 10K candidate video essays that pair professional commentary with visual demonstration. To capture the open-ended nature of artistic analysis at scale, the benchmark combines single-select and variable-option multi-select questions. All questions are generated and refined through a four-phase iterative pipeline combining shortcut filtering, adversarial distractors, and expert validation. Comprehensive zero-shot evaluation of 28 state-of-the-art MLLMs reveals that even the best-performing model achieves only 48.29% accuracy, substantially below human expert performance of 87.18%, exposing a significant gap in current models' creative domain expertise.