VIBE : Évaluation ouverte des biais induits par la voix pour les grands modèles audio-langage via la parole réelle
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
July 3, 2026
Auteurs: Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang, Hung-yi Lee
cs.AI
Résumé
Les modèles Audio-Langage de Grande Taille (LALMs) sont de plus en plus intégrés dans les applications quotidiennes, mais leurs biais génératifs restent peu explorés. Les référentiels existants d'équité pour la parole reposent sur la parole synthétique et des questions à choix multiples (QCM), offrant tous deux une vision fragmentée de l'équité. Nous proposons VIBE, un cadre qui évalue le biais génératif à travers des tâches ouvertes telles que les recommandations personnalisées, en utilisant la parole enregistrée par des humains. Contrairement aux QCM, notre méthode permet aux associations stéréotypées de se manifester organiquement sans options prédéfinies, ce qui la rend facilement extensible à de nouvelles tâches. L'évaluation de 12 LALMs de pointe révèle des biais systématiques dans des scénarios réalistes. Les indices de genre et d'accent déclenchent des changements distributionnels statistiquement significatifs, et l'ampleur des biais est fortement dépendante de la tâche.
English
Large Audio-Language Models (LALMs) are increasingly integrated into daily applications, yet their generative biases remain underexplored. Existing speech fairness benchmarks rely on synthetic speech and Multiple-Choice Questions (MCQs), both offering a fragmented view of fairness. We propose VIBE, a framework that evaluates generative bias through open-ended tasks such as personalized recommendations, using human-recorded speech. Unlike MCQs, our method allows stereotypical associations to manifest organically without predefined options, making it easily extensible to new tasks. Evaluating 12 state-of-the-art LALMs reveals systematic biases in realistic scenarios. Both gender and accent cues trigger statistically significant distributional shifts, and bias magnitude is strongly task-dependent.