ChatPaper.aiChatPaper

Smaakgevoelige muziekretrieval op basis van audio-embeddings

Taste-aware music retrieval from audio embeddings

July 3, 2026
Auteurs: Matteo Spanio, Antonio Rodà
cs.AI

Samenvatting

Crossmodule overeenkomsten tussen geluid en smaak zijn goed gedocumenteerd in de psychologie en neurowetenschappen, maar grotendeels afwezig in content-gebaseerde multimedia retrieval. We formaliseren smaak-van-audio voorspelling als een content-gebaseerde muziekinformatie retrieval benchmark over een perceptueel gevalideerde multi-bron corpus, waarbij we tien bevroren audio-encoders uit de vier HEAR-families vergelijken onder een gedeelde multi-taak regressiehoofd, met gated late-fusie als een configureerbare variant. Om de effectiviteit van de modellen te beoordelen, berekenen we absolute fout en rangcorrelatie. De sterkste systemen voorspellen de vijf smaken binnen een macro RMSE van 0,134; op niet eerder gebruikte echte muziek is hun fout minder dan de helft van de afwijking van één beoordelaar van de consensus (RMSE 0,13 vs. 0,28), dus het model volgt de groepsconsensus nauwkeuriger dan een gemiddelde menselijke beoordelaar, en ruim onder de vorige state-of-the-art basislijn (0,219). Wat absolute fout betreft zijn de encoders statistisch vlak, waarbij een enkele VGGish overeenkomt met de beste fusie, maar het voordeel van gated late-fusie blijft beperkt tot rangcorrelatie (macro Pearson r 0,724 vs. 0,666). Geoperationaliseerd als een content-gebaseerde retrieval index rangschikt de voorspelde smaakruimte een pool van 309 items veel getrouwer dan een CLAP-tekst basislijn, die op kansniveau presteert; ridge probes en een audio-bandstop knockout lezen de sterkste representaties af tegenover gedocumenteerde geluid-smaak correspondenties.
English
Crossmodal correspondences between sound and taste are well established in psychology and neuroscience, but largely absent from content-based multimedia retrieval. We formalise taste-from-audio prediction as a content-based music information retrieval benchmark over a perceptually validated multi-source corpus, comparing ten frozen audio encoders from the four HEAR families under a shared multi-task regression head, with gated late-fusion as a configurable variant. In order to assess the effectiveness of the models, we compute absolute error and rank correlation. The strongest systems predict the five tastes within a macro RMSE of 0.134; on held-out real music their error is less than half a single rater's deviation from the consensus (RMSE 0.13 vs. 0.28), so the model tracks the group consensus more closely than an average human rater, and well below the previous state of the art baseline (0.219). On absolute error the encoders are statistically flat, with a single VGGish matching the best fusion, but gated late-fusion's advantage is confined to rank correlation (macro Pearson r 0.724 vs. 0.666). Operationalised as a content-based retrieval index, the predicted taste space ranks a 309-item pool far more faithfully than a CLAP-text baseline, which sits at chance; ridge probes and an audio-bandstop knockout read the strongest representations against documented sound-taste correspondences.