SIFT-50M: Масштабный многоязычный набор данных для тонкой настройки речевых инструкций

Аннотация

Мы представляем SIFT (Speech Instruction Fine-Tuning) — набор данных из 50 миллионов примеров, предназначенный для тонкой настройки и предварительного обучения крупных языковых моделей (LLM), работающих с речью и текстом. SIFT-50M создан на основе общедоступных речевых корпусов, которые в совокупности содержат 14 тысяч часов речи, и использует LLM вместе с готовыми экспертными моделями. Набор данных охватывает пять языков и включает разнообразные инструкции для понимания речи и управляемой генерации речи. С использованием SIFT-50M мы обучаем модель SIFT-LLM, которая превосходит существующие речево-текстовые LLM на тестах по выполнению инструкций, одновременно демонстрируя конкурентоспособные результаты на базовых задачах обработки речи. Для поддержки дальнейших исследований мы также представляем EvalSIFT — эталонный набор данных, специально разработанный для оценки способности речево-текстовых LLM следовать инструкциям.

English

We introduce SIFT (Speech Instruction Fine-Tuning), a 50M-example dataset designed for instruction fine-tuning and pre-training of speech-text large language models (LLMs). SIFT-50M is built from publicly available speech corpora, which collectively contain 14K hours of speech, and leverages LLMs along with off-the-shelf expert models. The dataset spans five languages, encompassing a diverse range of speech understanding as well as controllable speech generation instructions. Using SIFT-50M, we train SIFT-LLM, which outperforms existing speech-text LLMs on instruction-following benchmarks while achieving competitive performance on foundational speech tasks. To support further research, we also introduce EvalSIFT, a benchmark dataset specifically designed to evaluate the instruction-following capabilities of speech-text LLMs.