Vividh-ASR : un benchmark à niveaux de complexité et des dynamiques d'optimisation pour une reconnaissance robuste de la parole indienne
Vividh-ASR: A Complexity-Tiered Benchmark and Optimization Dynamics for Robust Indic Speech Recognition
May 13, 2026
Auteurs: Kush Juvekar, Kavya Manohar, Aditya Srinivas Menon, Arghya Bhattacharya, Kumarmanas Nethil
cs.AI
Résumé
Le réglage fin de modèles ASR multilingues comme Whisper pour des langues peu dotées améliore souvent la parole lue, mais dégrade les performances sur l'audio spontané, un phénomène que nous appelons le biais de studio. Pour diagnostiquer ce décalage, nous présentons Vividh-ASR, un benchmark stratifié par complexité pour l'hindi et le malayalam, couvrant quatre niveaux : studio, diffusion, spontané et bruit synthétique. Grâce à une étude contrôlée du moment du taux d'apprentissage et de l'ordre curriculaire, nous constatons que des mises à jour précoces des paramètres à grande échelle améliorent le WER global de 12 points absolus, tandis qu'un ordre curriculaire du difficile au facile apporte des gains supplémentaires pour la parole spontanée. Ces résultats motivent le réglage fin multi-étapes inversé (R-MFT), une recette d'entraînement qui permet à un modèle Whisper de 244M de paramètres, efficace en paramètres, d'égaler ou de surpasser des homologues de 769M paramètres réglés de manière conventionnelle. L'analyse représentationnelle via CKA et SVD révèle que les stratégies efficaces concentrent l'adaptation dans le décodeur, préservant la géométrie acoustique de l'encodeur pré-entraîné. Nous publions le benchmark et les modèles.
English
Fine-tuning multilingual ASR models like Whisper for low-resource languages often improves read speech but degrades spontaneous audio performance, a phenomenon we term studio-bias. To diagnose this mismatch, we introduce Vividh-ASR, a complexity-stratified benchmark for Hindi and Malayalam across four tiers: studio, broadcast, spontaneous, and synthetic noise. Through a controlled study of learning-rate timing and curriculum ordering, we find that early large parameter updates improve global WER by 12 absolute points, while a hard-to-easy curriculum adds gains for spontaneous speech. These findings motivate reverse multi-stage fine-tuning (R-MFT), a training recipe that enables a parameter-efficient 244M Whisper model to match or exceed conventionally fine-tuned 769M counterparts. Representational analysis via CKA and SVD reveals effective schedules concentrate adaptation in the decoder, preserving the pre-trained encoder's acoustic geometry. We release the benchmark and models.