GigaAM Multilingual: 저자원 언어를 위한 파운데이션 모델
GigaAM Multilingual: Foundation Model for Underrepresented Languages
July 11, 2026
저자: Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin
cs.AI
초록
최근 확장에서의 성공에도 불구하고, 다국어 자동 음성 인식(ASR) 성능은 여전히 매우 불균형적이며, 특히 장기 저빈도 언어들은 심각한 데이터 부족 문제를 겪고 있습니다. 본 연구는 저대표 중앙아시아 언어(카자흐어, 키르기스어, 우즈베크어)를 위한 강건한 기초 모델을 구축하는 과제를 다룹니다. 우리는 HuBERT 스타일의 목적 함수를 사용하여 2백만 시간의 오디오로 사전 학습된 Conformer 인코더인 GigaAM Multilingual을 제시합니다. 핵심적으로, 사전 학습 시 클러스터 수준의 데이터 균형 전략과 미세 조정 시 도메인 인식 샘플링 방법을 도입하여 주류 언어 우세 현상을 완화합니다. 통제된 비교 실험에서, 우리의 접근 방식은 대상 언어에서 강력한 공개 사전 학습 인코더(Whisper Large v3, Omnilingual-1B)를 능가하며, 자발적 발화에서 상당한 성능 향상을 달성하면서도 효율성을 유지합니다. 우리는 기초 인코더와 ASR 모델을 공개하며, 현실적인 데이터 불균형 상황에서 효과적인 다국어 적응을 위한 검증된 방법을 제공합니다.
English
Despite recent scaling successes, multilingual ASR performance remains highly uneven, with long-tail languages suffering from severe data scarcity. This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages (Kazakh, Kyrgyz, Uzbek). We present GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective. Crucially, we introduce a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance. In controlled comparisons, our approach outperforms strong open pretrained encoders (Whisper Large v3, Omnilingual-1B) on target languages, achieving significant gains on spontaneous speech while maintaining efficiency. We release the foundation encoder and ASR model, offering a proven recipe for effective multilingual adaptation under realistic data imbalance.