ChatPaper.aiChatPaper

RedVox: Veiligheids- en eerlijkheidshiaten in spraakmodellen tussen talen

RedVox: Safety and Fairness Gaps in Speech Models Across Languages

June 25, 2026
Auteurs: Beatrice Savoldi, Sara Papi, Wafa Aissa, Matteo Negri, Luisa Bentivogli
cs.AI

Samenvatting

Spraakmodellen worden steeds vaker ingezet in praktijktoepassingen in meerdere talen. Toch blijft hun veiligheid en rechtvaardigheid buiten Engelstalige contexten en onder naturalistische omstandigheden onderbelicht. We onderzoeken de veiligheidsrapportagepraktijken bij de release van state-of-the-art spraakmodellen en constateren dat slechts 8% enige meertalige analyse documenteert. Om deze lacune aan te pakken, introduceren we RedVox, een meertalige veiligheids- en rechtvaardigheidsbenchmark voor audio en spraak, gebaseerd op echte stemmen, die onveilige en onrechtvaardige stereotiepe verzoeken dekt in vijf talen (Engels, Frans, Italiaans, Spaans en Duits). Bij de evaluatie van acht state-of-the-art modellen stellen we vast dat kwetsbaarheden blijven bestaan, zelfs onder niet-adversariële omstandigheden, verergeren in niet-Engelse talen en worden versterkt wanneer het verzoek afkomstig is van een gesproken invoer. Tot slot documenteren we, door middel van een enquête onder de deelnemers die aan RedVox hebben bijgedragen, de unieke persoonlijke en privacy-uitdagingen van het verzamelen van spraakgegevens met menselijke deelnemers, wat wijst op bredere sociaaltechnische uitdagingen in naturalistisch spraakveiligheidsonderzoek.
English
Speech-capable models are increasingly deployed in real-world applications across languages. Yet their safety and fairness beyond English settings and under naturalistic conditions remain understudied. We survey safety reporting practices across state-of-the-art speech model releases, finding that only 8% document any multilingual analysis. To address this gap, we introduce RedVox, a multilingual safety and fairness benchmark for audio and speech built on real voices, covering unsafe and unfair stereotypical requests across five languages (English, French, Italian, Spanish, and German). Evaluating eight state-of-the-art models, we find that vulnerabilities persist even under non-adversarial conditions, worsen in non-English languages, and are amplified when the request comes from a spoken input. Finally, by surveying the participants who contributed to RedVox, we document the unique personal and privacy challenges of collecting speech data with human participants, pointing to broader sociotechnical challenges in naturalistic speech safety research.