Recuperação de música com consciência do gosto a partir de embeddings de áudio
Taste-aware music retrieval from audio embeddings
July 3, 2026
Autores: Matteo Spanio, Antonio Rodà
cs.AI
Resumo
Correspondências crossmodais entre som e paladar são bem estabelecidas na psicologia e neurociência, mas amplamente ausentes da recuperação multimídia baseada em conteúdo. Formalizamos a previsão de paladar a partir de áudio como um benchmark de recuperação de informação musical baseada em conteúdo sobre um corpus multifornne perceptualmente validado, comparando dez codificadores de áudio congelados das quatro famílias HEAR sob uma cabeça de regressão multitarefa compartilhada, com fusão tardia com portão como uma variante configurável. Para avaliar a eficácia dos modelos, calculamos o erro absoluto e a correlação de postos. Os sistemas mais fortes preveem os cinco paladares dentro de um RMSE macro de 0,134; em música real de teste, seu erro é menor que metade do desvio de um único avaliador em relação ao consenso (RMSE 0,13 vs. 0,28), de modo que o modelo acompanha o consenso do grupo mais de perto do que um avaliador humano médio, e bem abaixo da linha de base do estado da arte anterior (0,219). Em erro absoluto, os codificadores são estatisticamente planos, com um único VGGish igualando a melhor fusão, mas a vantagem da fusão tardia com portão está confinada à correlação de postos (Pearson r macro 0,724 vs. 0,666). Operacionalizado como um índice de recuperação baseado em conteúdo, o espaço de paladar previsto classifica um conjunto de 309 itens de forma muito mais fiel do que uma linha de base CLAP-text, que fica ao acaso; sondas ridge e um knockout de banda de áudio leem as representações mais fortes contra correspondências documentadas de som e paladar.
English
Crossmodal correspondences between sound and taste are well established in psychology and neuroscience, but largely absent from content-based multimedia retrieval. We formalise taste-from-audio prediction as a content-based music information retrieval benchmark over a perceptually validated multi-source corpus, comparing ten frozen audio encoders from the four HEAR families under a shared multi-task regression head, with gated late-fusion as a configurable variant. In order to assess the effectiveness of the models, we compute absolute error and rank correlation. The strongest systems predict the five tastes within a macro RMSE of 0.134; on held-out real music their error is less than half a single rater's deviation from the consensus (RMSE 0.13 vs. 0.28), so the model tracks the group consensus more closely than an average human rater, and well below the previous state of the art baseline (0.219). On absolute error the encoders are statistically flat, with a single VGGish matching the best fusion, but gated late-fusion's advantage is confined to rank correlation (macro Pearson r 0.724 vs. 0.666). Operationalised as a content-based retrieval index, the predicted taste space ranks a 309-item pool far more faithfully than a CLAP-text baseline, which sits at chance; ridge probes and an audio-bandstop knockout read the strongest representations against documented sound-taste correspondences.