VIBE: Evaluación abierta de sesgos inducidos por voz para grandes modelos de audio-lenguaje mediante habla del mundo real
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
July 3, 2026
Autores: Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang, Hung-yi Lee
cs.AI
Resumen
Los Modelos de Lenguaje y Audio a Gran Escala (LALMs, por sus siglas en inglés) se integran cada vez más en aplicaciones cotidianas; sin embargo, sus sesgos generativos siguen siendo poco explorados. Los puntos de referencia existentes sobre equidad en el habla dependen de habla sintética y preguntas de opción múltiple (MCQ), ambos ofreciendo una visión fragmentada de la equidad. Proponemos VIBE, un marco que evalúa el sesgo generativo a través de tareas abiertas, como recomendaciones personalizadas, utilizando habla grabada por humanos. A diferencia de los MCQ, nuestro método permite que las asociaciones estereotípicas se manifiesten de forma orgánica sin opciones predefinidas, lo que lo hace fácilmente extensible a nuevas tareas. La evaluación de 12 LALMs de última generación revela sesgos sistemáticos en escenarios realistas. Tanto las señales de género como las de acento provocan cambios de distribución estadísticamente significativos, y la magnitud del sesgo depende fuertemente de la tarea.
English
Large Audio-Language Models (LALMs) are increasingly integrated into daily applications, yet their generative biases remain underexplored. Existing speech fairness benchmarks rely on synthetic speech and Multiple-Choice Questions (MCQs), both offering a fragmented view of fairness. We propose VIBE, a framework that evaluates generative bias through open-ended tasks such as personalized recommendations, using human-recorded speech. Unlike MCQs, our method allows stereotypical associations to manifest organically without predefined options, making it easily extensible to new tasks. Evaluating 12 state-of-the-art LALMs reveals systematic biases in realistic scenarios. Both gender and accent cues trigger statistically significant distributional shifts, and bias magnitude is strongly task-dependent.