GigaAM Multilingual:針對代表性不足語言的基礎模型
GigaAM Multilingual: Foundation Model for Underrepresented Languages
July 11, 2026
作者: Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin
cs.AI
摘要
儘管近期擴展取得顯著成果,多語言語音辨識(ASR)的表現仍高度不均,長尾語言因嚴重數據稀缺而受影響。本研究致力於為代表性不足的中亞語言(哈薩克語、吉爾吉斯語、烏茲別克語)建立穩健的基礎模型。我們提出 GigaAM Multilingual,這是一個基於 Conformer 架構的編碼器,使用 HuBERT 風格的目標以 200 萬小時音頻進行預訓練。關鍵在於,我們在預訓練階段引入了集群級數據平衡策略,並在微調階段採用領域感知採樣方法,以緩解主導語言偏差。在受控比較中,我們的方法在目標語言上優於強大的開源預訓練編碼器(Whisper Large v3、Omnilingual-1B),在自發語音上取得顯著進步,同時保持高效能。我們開源了基礎編碼器及 ASR 模型,為在實際數據不平衡下實現有效多語言適配提供了經過驗證的方案。
English
Despite recent scaling successes, multilingual ASR performance remains highly uneven, with long-tail languages suffering from severe data scarcity. This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages (Kazakh, Kyrgyz, Uzbek). We present GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective. Crucially, we introduce a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance. In controlled comparisons, our approach outperforms strong open pretrained encoders (Whisper Large v3, Omnilingual-1B) on target languages, achieving significant gains on spontaneous speech while maintaining efficiency. We release the foundation encoder and ASR model, offering a proven recipe for effective multilingual adaptation under realistic data imbalance.