ChatPaper.aiChatPaper

Recherche musicale consciente des goûts à partir de plongements audio

Taste-aware music retrieval from audio embeddings

July 3, 2026
Auteurs: Matteo Spanio, Antonio Rodà
cs.AI

Résumé

Les correspondances crossmodales entre le son et le goût sont bien établies en psychologie et en neurosciences, mais restent largement absentes de la recherche multimédia basée sur le contenu. Nous formalisons la prédiction du goût à partir de l’audio comme un repère de recherche d’information musicale basée sur le contenu, sur un corpus multisource validé perceptuellement, en comparant dix encodeurs audio figés issus des quatre familles HEAR sous une tête de régression multitâche partagée, avec une fusion tardive à porte logique comme variante configurable. Afin d’évaluer l’efficacité des modèles, nous calculons l’erreur absolue et la corrélation de rang. Les systèmes les plus performants prédisent les cinq goûts avec une RMSE macro de 0,134 ; sur de la musique réelle hors échantillon, leur erreur est inférieure à la moitié de l’écart-type d’un évaluateur unique par rapport au consensus (RMSE 0,13 contre 0,28), de sorte que le modèle suit le consensus du groupe plus étroitement qu’un évaluateur humain moyen, et bien en dessous du précédent état de l’art (0,219). En termes d’erreur absolue, les encodeurs sont statistiquement équivalents, un seul VGGish égalant la meilleure fusion, mais l’avantage de la fusion tardive à porte logique se limite à la corrélation de rang (r de Pearson macro 0,724 contre 0,666). Opérationnalisé comme un index de recherche basé sur le contenu, l’espace de goût prédit classe un ensemble de 309 éléments bien plus fidèlement qu’un texte de base CLAP, qui se situe au niveau du hasard ; des sondes de régression et un test d’élimination par bande audio révèlent les représentations les plus fortes par rapport aux correspondances son-goût documentées.
English
Crossmodal correspondences between sound and taste are well established in psychology and neuroscience, but largely absent from content-based multimedia retrieval. We formalise taste-from-audio prediction as a content-based music information retrieval benchmark over a perceptually validated multi-source corpus, comparing ten frozen audio encoders from the four HEAR families under a shared multi-task regression head, with gated late-fusion as a configurable variant. In order to assess the effectiveness of the models, we compute absolute error and rank correlation. The strongest systems predict the five tastes within a macro RMSE of 0.134; on held-out real music their error is less than half a single rater's deviation from the consensus (RMSE 0.13 vs. 0.28), so the model tracks the group consensus more closely than an average human rater, and well below the previous state of the art baseline (0.219). On absolute error the encoders are statistically flat, with a single VGGish matching the best fusion, but gated late-fusion's advantage is confined to rank correlation (macro Pearson r 0.724 vs. 0.666). Operationalised as a content-based retrieval index, the predicted taste space ranks a 309-item pool far more faithfully than a CLAP-text baseline, which sits at chance; ridge probes and an audio-bandstop knockout read the strongest representations against documented sound-taste correspondences.