ChatPaper.aiChatPaper

VIBE: Avaliação de Viés Induzido por Voz e de Formato Aberto para Grandes Modelos de Áudio-Linguagem via Fala do Mundo Real

VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

July 3, 2026
Autores: Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang, Hung-yi Lee
cs.AI

Resumo

Modelos de Áudio-Linguagem de Grande Porte (LALMs) estão cada vez mais integrados em aplicações cotidianas, porém seus vieses generativos ainda são pouco explorados. Os benchmarks existentes de imparcialidade de fala dependem de fala sintética e Perguntas de Múltipla Escolha (MCQs), ambos oferecendo uma visão fragmentada da imparcialidade. Propomos o VIBE, uma estrutura que avalia o viés generativo por meio de tarefas abertas, como recomendações personalizadas, utilizando fala gravada por humanos. Diferentemente das MCQs, nosso método permite que associações estereotípicas se manifestem organicamente sem opções predefinidas, tornando-se facilmente extensível a novas tarefas. A avaliação de 12 LALMs estado da arte revela vieses sistemáticos em cenários realistas. Tanto os sinais de gênero quanto de sotaque provocam mudanças distribucionais estatisticamente significativas, e a magnitude do viés é fortemente dependente da tarefa.
English
Large Audio-Language Models (LALMs) are increasingly integrated into daily applications, yet their generative biases remain underexplored. Existing speech fairness benchmarks rely on synthetic speech and Multiple-Choice Questions (MCQs), both offering a fragmented view of fairness. We propose VIBE, a framework that evaluates generative bias through open-ended tasks such as personalized recommendations, using human-recorded speech. Unlike MCQs, our method allows stereotypical associations to manifest organically without predefined options, making it easily extensible to new tasks. Evaluating 12 state-of-the-art LALMs reveals systematic biases in realistic scenarios. Both gender and accent cues trigger statistically significant distributional shifts, and bias magnitude is strongly task-dependent.