VIBE: Голосово-индуцированная оценка предвзятости открытого типа для больших аудио-языковых моделей на основе реальной речи
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
July 3, 2026
Авторы: Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang, Hung-yi Lee
cs.AI
Аннотация
Большие аудио-языковые модели (Large Audio-Language Models, LALM) всё чаще интегрируются в повседневные приложения, однако их генеративные предвзятости остаются малоизученными. Существующие критерии справедливости для речи опираются на синтезированную речь и вопросы с множественным выбором (Multiple-Choice Questions, MCQ), что даёт лишь фрагментарное представление о справедливости. Мы предлагаем VIBE — структуру, оценивающую генеративную предвзятость через задачи открытого типа, такие как персонализированные рекомендации, с использованием речи, записанной людьми. В отличие от MCQ, наш метод позволяет стереотипным ассоциациям проявляться естественным образом без заранее заданных вариантов, что делает его легко расширяемым на новые задачи. Оценка 12 современных LALM выявляет систематические предвзятости в реалистичных сценариях. Как гендерные, так и акцентные признаки вызывают статистически значимые сдвиги распределений, а величина предвзятости сильно зависит от задачи.
English
Large Audio-Language Models (LALMs) are increasingly integrated into daily applications, yet their generative biases remain underexplored. Existing speech fairness benchmarks rely on synthetic speech and Multiple-Choice Questions (MCQs), both offering a fragmented view of fairness. We propose VIBE, a framework that evaluates generative bias through open-ended tasks such as personalized recommendations, using human-recorded speech. Unlike MCQs, our method allows stereotypical associations to manifest organically without predefined options, making it easily extensible to new tasks. Evaluating 12 state-of-the-art LALMs reveals systematic biases in realistic scenarios. Both gender and accent cues trigger statistically significant distributional shifts, and bias magnitude is strongly task-dependent.