Melhorando a Geração de Música a partir de Texto com Recompensas de Preferência Humana
Improving Text-to-Music Generation with Human Preference Rewards
June 19, 2026
Autores: Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Chris Donahue
cs.AI
Resumo
Descrevemos a nossa inscrição na categoria de eficiência do Grand Challenge de Texto-para-Música Académico (ATTM) no ICME 2026. Para além do protocolo do desafio, que inclui as métricas FAD-CLAP e CLAP, adicionamos uma recompensa de preferência humana aprendida a partir do TuneJury, um ranqueador pareado duplo treinado em conjuntos de dados abertos de preferência musical. Esta recompensa serve tanto como sinal de condicionamento durante o treino como critério de seleção de amostras. O pipeline combina cinco decisões de engenharia num modelo base FluxAudio-S com 120 M de parâmetros, quatro durante o treino e uma na inferência: (i) condicionamento por recompensa durante o treino que funciona também como eixo CFG na inferência; (ii) uma varredura por cinco arquiteturas de condicionamento por pontuação, onde treino e inferência utilizam variantes diferentes; (iii) iteração especializada no decil superior; (iv) uma passagem curta de ajuste de preferência (CRPO) para alinhamento áudio-texto; e (v) pós-processamento na inferência via CFG conjunta, separação de fontes e normalização de loudness. A decomposição por etapas em 100 prompts Song Describer mostra que o condicionamento por recompensa durante o treino funciona como um eixo de condicionamento funcional, a iteração especializada é o contribuidor dominante, a passagem de ajuste de preferência adiciona apenas ganho ao nível do ruído, e o escalar de pontuação na inferência já está saturado no final da cadeia.
English
We describe our entry to the efficiency track of the Academic Text-to-Music (ATTM) Grand Challenge at ICME 2026. Beyond the challenge protocol's FAD-CLAP and CLAP score, we add a learned human-preference reward from TuneJury, a twin pairwise ranker trained over open music-preference datasets. The reward serves both as a training-time conditioning signal and as a sample-selection criterion. The pipeline combines five engineering decisions on a 120M-parameter FluxAudio-S backbone, four at training time and one at inference: (i) training-time reward conditioning that doubles as an inference-time CFG axis, (ii) a sweep over five score-conditioning architectures, where training and inference use different variants, (iii) expert iteration on the top decile, (iv) a short preference-tuning pass (CRPO) for audio-text alignment, and (v) inference post-processing via joint CFG, source separation, and loudness normalization. Per-stage decomposition on 100 Song Describer prompts shows training-time reward conditioning as a functional conditioning axis, expert iteration as the dominant contributor, the preference-tuning pass adding only noise-level gain, and the inference-time score scalar already saturated by the end of the chain.