ChatPaper.aiChatPaper

MuScriptor: Открытая модель для транскрипции музыки с несколькими инструментами

MuScriptor: An Open Model for Multi-Instrument Music Transcription

July 9, 2026
Авторы: Simon Rouard, Michael Krause, Axel Roebel, Carl-Johann Simon-Gabriel, Alexandre Défossez
cs.AI

Аннотация

Существующие методы автоматической транскрипции музыки часто ограничены одноголосными записями или не справляются со сложными реальными музыкальными сведениями. Хотя в предыдущих работах применялись синтетические обучающие данные, полученные модели плохо обобщаются, что приводит к практически непригодным результатам транскрипции в реалистичных многоголосных условиях. В данной работе мы анализируем эффективность использования синтетических данных для предварительного обучения в сочетании с точной настройкой на реальных аудиозаписях и последующим обучением с подкреплением. Кроме того, мы вводим обусловливание наличием инструментов для настройки транскрипций. Наконец, мы публикуем MuScriptor — многоголосную модель транскрипции музыки с открытым весом, работающую на реальных записях из различных музыкальных жанров.
English
Existing methods for automatic music transcription are often limited to single-instrument recordings or fail on complex, real music mixes. Although previous work utilizes synthetic training data, the resulting models generalize poorly, leading to largely unusable transcription output in realistic, multi-instrument settings. In this work, we analyze the effectiveness of synthetic data for pre-training while combining it with fine-tuning on real music audio and post-training using reinforcement learning. We further introduce conditioning on instrument presence to customize transcriptions. Finally, we release MuScriptor, an open-weight multi-instrument music transcription model that works on real-world music recordings from across a diverse range of musical genres.