MuScriptor: Un Modelo Abierto para la Transcripción Musical Multiinstrumento
MuScriptor: An Open Model for Multi-Instrument Music Transcription
July 9, 2026
Autores: Simon Rouard, Michael Krause, Axel Roebel, Carl-Johann Simon-Gabriel, Alexandre Défossez
cs.AI
Resumen
Los métodos existentes para la transcripción automática de música suelen limitarse a grabaciones de un solo instrumento o fallan en mezclas musicales complejas y reales. Aunque trabajos previos utilizan datos de entrenamiento sintéticos, los modelos resultantes generalizan mal, lo que genera resultados de transcripción en gran medida inutilizables en entornos realistas y multiinstrumento. En este trabajo, analizamos la eficacia de los datos sintéticos para el preentrenamiento, combinándolos con un ajuste fino en audio musical real y un entrenamiento posterior mediante aprendizaje por refuerzo. Además, introducimos un condicionamiento en la presencia de instrumentos para personalizar las transcripciones. Finalmente, publicamos MuScriptor, un modelo de transcripción musical multiinstrumento de pesos abiertos que funciona con grabaciones musicales del mundo real de una amplia variedad de géneros musicales.
English
Existing methods for automatic music transcription are often limited to single-instrument recordings or fail on complex, real music mixes. Although previous work utilizes synthetic training data, the resulting models generalize poorly, leading to largely unusable transcription output in realistic, multi-instrument settings. In this work, we analyze the effectiveness of synthetic data for pre-training while combining it with fine-tuning on real music audio and post-training using reinforcement learning. We further introduce conditioning on instrument presence to customize transcriptions. Finally, we release MuScriptor, an open-weight multi-instrument music transcription model that works on real-world music recordings from across a diverse range of musical genres.