ChatPaper.aiChatPaper

MuSViT: Um Modelo de Visão Fundamental para Representação de Partitura Musical

MuSViT: A Foundation Vision Model for Sheet Music Representation

June 30, 2026
Autores: Carlos Penarrubia, Antonio Rios-Vila, Eliseo Fuentes-Martinez, Juan C. Martinez-Sevilla, Francisco J. Castellanos, María Alfaro-Contreras, Jorge Calvo-Zaragoza
cs.AI

Resumo

Modelos fundamentais transformaram o processamento de visão e linguagem ao fornecer representações ricas e reutilizáveis que são transferidas entre diversas tarefas. A partitura musical, como uma codificação visual da linguagem musical, carece de um backbone específico do domínio tão robusto. Apresentamos o MuSViT (Music Score Vision Transformer): o primeiro modelo de visão fundamental para representação de partituras — um codificador ViT pré-treinado via Autoencoders Mascarados em 9,7 milhões de páginas do IMSLP. Para lidar com a complexidade de partituras do mundo real, adotamos um currículo de dois estágios: um aquecimento sintético em partituras tipográficas, seguido por treinamento em larga escala no corpus completo do IMSLP. Avaliamos o MuSViT em quatro tarefas downstream — reconhecimento de partitura em página inteira e em nível de pauta, detecção de símbolos musicais e classificação de dificuldade da partitura — sob dois cenários: sonda linear (codificador congelado) e ajuste fino. Sob sonda linear, o MuSViT supera consistentemente codificadores de visão modernos, revelando que representações de propósito geral, independentemente da escala, ficam sistematicamente aquém das propriedades simbólicas estruturadas da notação musical. Sob ajuste fino, o MuSViT geralmente melhora os métodos de estado da arte específicos da tarefa. Uma análise adicional de consistência entre incorporação e transcrição revela que o MuSViT codifica diretamente a estrutura musical simbólica em seu espaço de representação — ao contrário de outros codificadores, cujas incorporações não se correlacionam com o conteúdo da notação musical. Esses resultados estabelecem o MuSViT como um backbone fundamental para a compreensão de partituras.
English
Foundation models have transformed vision and language processing by providing rich, reusable representations that transfer across diverse tasks. Sheet music, as a visual encoding of musical language, lacks such a strong domain-specific backbone. We introduce MuSViT (Music Score Vision Transformer): the first foundation vision model for sheet music representation -- a ViT encoder pre-trained via Masked Autoencoders on 9.7 million pages from the IMSLP. To handle the complexity of real-world scores, we adopt a two-stage curriculum: a synthetic warm-up on typeset scores followed by large-scale training on the full IMSLP corpus. We evaluate MuSViT on four downstream tasks -- full-page and staff-level music score recognition, music symbol detection, and score difficulty classification -- under two scenarios: linear probing (frozen encoder) and fine-tuning. Under linear probing, MuSViT consistently outperforms modern vision encoders, revealing that general-purpose representations, regardless of scale, fall systematically short on the structured symbolic properties of musical notation. Under fine-tuning, MuSViT generally improves upon task-specific state-of-the-art methods. An additional embedding-transcription consistency analysis reveals that MuSViT encodes symbolic musical structure directly in its representation space -- unlike other encoders, whose embeddings do not correlate with music notation content. These results establish MuSViT as a foundation backbone for sheet music understanding.