Единый аудиоинтеллект без регресса текстового интеллекта
Unified Audio Intelligence Without Regressing on Text Intelligence
July 6, 2026
Авторы: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping
cs.AI
Аннотация
Аудиоинтеллект включает в себя понимание, рассуждение и генерацию как аудио, так и речи. В данной работе мы представляем Nemotron-Labs-Audex-30B-A3B (Audex) — унифицированную аудио-текстовую большую языковую модель (LLM), построенную на основе Nemotron-Cascade-2-30B-A3B, мощной текстовой LLM на архитектуре смеси экспертов (MoE). Audex использует простую унифицированную конструкцию с единственным декодером Transformer: аудиовходы кодируются и проецируются в пространство текстовых эмбеддингов, а текстовые токены и квантованные аудиотокены на выходе обрабатываются единообразно в процессе генерации. Такая архитектура обеспечивает сильное слияние аудио и текста, бесшовную мультимодальную генерацию, а также совместимость со стандартной инфраструктурой обучения и вывода LLM. Для обучения мы тщательно подобрали аудио-текстовые наборы данных, содержащие 157,4 млрд аудиотокенов и 320,5 млрд текстовых токенов. Мы применили многоэтапное контролируемое обучение на этих данных, за которым последовали каскадное обучение с подкреплением только на тексте и мультидоменная дистилляция на политике. Audex обеспечивает передовое понимание аудио, распознавание и перевод речи, синтез речи, генерацию аудио и преобразование речи в речь, сохраняя при этом очень убедительные способности к рассуждению, выравниванию, знанию, работе с длинным контекстом и агентные способности своей текстовой LLM-основы с минимальной регрессией или без неё. Мы публикуем контрольные точки модели для содействия открытым исследованиям.
English
Audio intelligence involves understanding, reasoning about, and generating both audio and speech. In this work, we introduce Nemotron-Labs-Audex-30B-A3B (Audex), a unified audio-text LLM built on Nemotron-Cascade-2-30B-A3B, a strong text-only MoE LLM. Audex adopts a simple unified design with a single Transformer decoder: audio inputs are encoded and projected into the text embedding space, while text tokens and quantized audio output tokens are treated uniformly during generation. This architecture enables strong audio-text fusion, seamless multimodal generation, and compatibility with standard LLM training and inference infrastructure. For training, we meticulously curate audio-text datasets comprising 157.4B audio tokens and 320.5B text tokens. We apply multi-stage supervised training on these datasets, followed by text-only Cascade RL and multi-domain on-policy distillation. Audex delivers state-of-the-art audio understanding, speech recognition and translation, text-to-speech, audio generation, and speech-to-speech generation, while preserving very compelling reasoning, alignment, knowledge, long-context, and agentic capabilities of its text-only LLM backbone with marginal or no regression. We release the model checkpoints to facilitate open research.