Recuperación de música basada en el gusto a partir de embeddings de audio
Taste-aware music retrieval from audio embeddings
July 3, 2026
Autores: Matteo Spanio, Antonio Rodà
cs.AI
Resumen
Las correspondencias crossmodales entre sonido y gusto están bien establecidas en psicología y neurociencia, pero están prácticamente ausentes en la recuperación multimedia basada en contenido. Formalizamos la predicción del gusto a partir del audio como un punto de referencia de recuperación de información musical basada en contenido sobre un corpus multisource validado perceptualmente, comparando diez codificadores de audio congelados de las cuatro familias HEAR bajo un cabezal de regresión multitarea compartido, con fusión tardía con compuerta como variante configurable. Para evaluar la efectividad de los modelos, calculamos el error absoluto y la correlación de rango. Los sistemas más sólidos predicen los cinco gustos con un RMSE macro de 0.134; en música real no vista, su error es inferior a la mitad de la desviación de un único evaluador respecto al consenso (RMSE 0.13 frente a 0.28), por lo que el modelo sigue el consenso del grupo más fielmente que un evaluador humano promedio, y muy por debajo de la línea base de referencia del estado del arte anterior (0.219). En error absoluto, los codificadores son estadísticamente planos, con un único VGGish igualando la mejor fusión, pero la ventaja de la fusión tardía con compuerta se limita a la correlación de rango (r de Pearson macro 0.724 vs. 0.666). Operacionalizado como un índice de recuperación basado en contenido, el espacio de sabor predicho clasifica un conjunto de 309 ítems de manera mucho más fiel que una línea base de texto CLAP, la cual se sitúa al nivel del azar; las sondas ridge y una eliminación de bandas de audio interpretan las representaciones más sólidas frente a las correspondencias documentadas entre sonido y gusto.
English
Crossmodal correspondences between sound and taste are well established in psychology and neuroscience, but largely absent from content-based multimedia retrieval. We formalise taste-from-audio prediction as a content-based music information retrieval benchmark over a perceptually validated multi-source corpus, comparing ten frozen audio encoders from the four HEAR families under a shared multi-task regression head, with gated late-fusion as a configurable variant. In order to assess the effectiveness of the models, we compute absolute error and rank correlation. The strongest systems predict the five tastes within a macro RMSE of 0.134; on held-out real music their error is less than half a single rater's deviation from the consensus (RMSE 0.13 vs. 0.28), so the model tracks the group consensus more closely than an average human rater, and well below the previous state of the art baseline (0.219). On absolute error the encoders are statistically flat, with a single VGGish matching the best fusion, but gated late-fusion's advantage is confined to rank correlation (macro Pearson r 0.724 vs. 0.666). Operationalised as a content-based retrieval index, the predicted taste space ranks a 309-item pool far more faithfully than a CLAP-text baseline, which sits at chance; ridge probes and an audio-bandstop knockout read the strongest representations against documented sound-taste correspondences.