GigaAM Multilingual: 低リソース言語のための基盤モデル
GigaAM Multilingual: Foundation Model for Underrepresented Languages
July 11, 2026
著者: Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin
cs.AI
要旨
近年のスケーリングの成功にもかかわらず、多言語ASRの性能は依然として非常に不均一であり、テール言語群は深刻なデータ不足に悩まされている。本研究では、過小評価されている中央アジアの言語(カザフ語、キルギス語、ウズベク語)に対して、堅牢な基盤モデルを構築するという課題に取り組む。我々は、HuBERTスタイルの目的関数を用いて2M時間の音声データで事前学習されたConformerエンコーダー「GigaAM Multilingual」を提案する。重要なのは、事前学習時にクラスターレベルのデータバランス戦略を導入し、ファインチューニング時にはドメイン認識サンプリング手法を用いることで、主要言語による支配を緩和した点である。比較実験において、本手法は対象言語において強力な既存のオープン事前学習エンコーダー(Whisper Large v3、Omnilingual-1B)を上回り、特に自然会話音声において顕著な性能向上を達成しつつ、効率性も維持している。我々は基盤エンコーダーとASRモデルを公開し、現実的なデータ不均衡下での効果的な多言語適応のための実証済み手法を提供する。
English
Despite recent scaling successes, multilingual ASR performance remains highly uneven, with long-tail languages suffering from severe data scarcity. This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages (Kazakh, Kyrgyz, Uzbek). We present GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective. Crucially, we introduce a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance. In controlled comparisons, our approach outperforms strong open pretrained encoders (Whisper Large v3, Omnilingual-1B) on target languages, achieving significant gains on spontaneous speech while maintaining efficiency. We release the foundation encoder and ASR model, offering a proven recipe for effective multilingual adaptation under realistic data imbalance.