GigaAM 多语言:面向低资源语言的基础模型
GigaAM Multilingual: Foundation Model for Underrepresented Languages
July 11, 2026
作者: Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin
cs.AI
摘要
尽管近期在扩展规模方面取得了成功,多语言自动语音识别(ASR)的性能仍然极不均衡,其中长尾语言因严重的数据匮乏而表现不佳。本研究旨在解决为代表性不足的中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)构建稳健基础模型的挑战。我们提出了GigaAM Multilingual模型,这是一个采用Conformer编码器、基于HuBERT风格目标在200万小时音频上预训练的模型。关键之处在于,我们在预训练过程中引入了聚类级别的数据平衡策略,并在微调阶段采用了领域感知的采样方法,以缓解主导语言带来的偏差。在控制变量对比中,我们的方法在目标语言上的表现超越了强大的开源预训练编码器(Whisper Large v3、Omnilingual-1B),在自发性语音上取得了显著提升,同时保持了高效性。我们公开了基础编码器和ASR模型,为在现实数据不平衡条件下实现有效的多语言适配提供了一套经过验证的方案。
English
Despite recent scaling successes, multilingual ASR performance remains highly uneven, with long-tail languages suffering from severe data scarcity. This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages (Kazakh, Kyrgyz, Uzbek). We present GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective. Crucially, we introduce a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance. In controlled comparisons, our approach outperforms strong open pretrained encoders (Whisper Large v3, Omnilingual-1B) on target languages, achieving significant gains on spontaneous speech while maintaining efficiency. We release the foundation encoder and ASR model, offering a proven recipe for effective multilingual adaptation under realistic data imbalance.