ChatPaper.aiChatPaper

Поиск музыки с учетом предпочтений на основе аудиоэмбеддингов

Taste-aware music retrieval from audio embeddings

July 3, 2026
Авторы: Matteo Spanio, Antonio Rodà
cs.AI

Аннотация

Кроссмодальные соответствия между звуком и вкусом хорошо обоснованы в психологии и нейронауке, но практически отсутствуют в контентно-ориентированном поиске мультимедиа. Мы формализуем задачу предсказания вкуса по аудио как эталонный тест для поиска музыкальной информации на основе контента, используя верифицированный с точки зрения перцепции мультиисточниковый корпус. Сравниваются десять замороженных аудиокодеров из четырёх семейств HEAR под общей головой многозадачной регрессии с гейтированной поздней фузией в качестве настраиваемого варианта. Для оценки эффективности моделей вычисляются абсолютная ошибка и ранговая корреляция. Наиболее сильные системы предсказывают пять вкусов с макро-RMSE 0,134; на отложенной реальной музыке их ошибка составляет менее половины отклонения отдельного оценщика от консенсуса (RMSE 0,13 против 0,28), то есть модель отслеживает групповой консенсус точнее, чем средний человеческий оценщик, и значительно ниже предыдущего современного базового уровня (0,219). По абсолютной ошибке кодеры статистически однородны: один VGGish достигает того же результата, что и лучшая фузия, однако преимущество гейтированной поздней фузии ограничивается ранговой корреляцией (макро-Пирсон r 0,724 против 0,666). При операционализации в качестве индекса контентно-ориентированного поиска предсказанное вкусовое пространство ранжирует пул из 309 элементов значительно точнее, чем базовый CLAP-текст, работающий на уровне случайности; ридж-зонды и аудио-полосовое подавление (knockout) выявляют сильнейшие представления в соответствии с документированными связями звука и вкуса.
English
Crossmodal correspondences between sound and taste are well established in psychology and neuroscience, but largely absent from content-based multimedia retrieval. We formalise taste-from-audio prediction as a content-based music information retrieval benchmark over a perceptually validated multi-source corpus, comparing ten frozen audio encoders from the four HEAR families under a shared multi-task regression head, with gated late-fusion as a configurable variant. In order to assess the effectiveness of the models, we compute absolute error and rank correlation. The strongest systems predict the five tastes within a macro RMSE of 0.134; on held-out real music their error is less than half a single rater's deviation from the consensus (RMSE 0.13 vs. 0.28), so the model tracks the group consensus more closely than an average human rater, and well below the previous state of the art baseline (0.219). On absolute error the encoders are statistically flat, with a single VGGish matching the best fusion, but gated late-fusion's advantage is confined to rank correlation (macro Pearson r 0.724 vs. 0.666). Operationalised as a content-based retrieval index, the predicted taste space ranks a 309-item pool far more faithfully than a CLAP-text baseline, which sits at chance; ridge probes and an audio-bandstop knockout read the strongest representations against documented sound-taste correspondences.