ChatPaper.aiChatPaper

Intelligence Audio Unifiée sans Régression sur l'Intelligence Textuelle

Unified Audio Intelligence Without Regressing on Text Intelligence

July 6, 2026
Auteurs: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping
cs.AI

Résumé

L'intelligence audio implique la compréhension, le raisonnement et la génération à la fois de l'audio et de la parole. Dans ce travail, nous présentons Nemotron-Labs-Audex-30B-A3B (Audex), un LLM audio-texte unifié construit sur Nemotron-Cascade-2-30B-A3B, un LLM MoE purement textuel robuste. Audex adopte une conception unifiée simple avec un seul décodeur Transformer : les entrées audio sont encodées et projetées dans l'espace d'embedding du texte, tandis que les tokens de texte et les tokens de sortie audio quantifiés sont traités de manière uniforme lors de la génération. Cette architecture permet une forte fusion audio-texte, une génération multimodale fluide et une compatibilité avec l'infrastructure standard d'entraînement et d'inférence des LLM. Pour l'entraînement, nous avons soigneusement constitué des ensembles de données audio-texte comprenant 157,4 milliards de tokens audio et 320,5 milliards de tokens texte. Nous appliquons un apprentissage supervisé en plusieurs étapes sur ces ensembles de données, suivi d'un RL en cascade purement textuel et d'une distillation multi-domaine sur politique. Audex atteint des performances de pointe en compréhension audio, reconnaissance et traduction de la parole, synthèse vocale, génération audio et génération parole-parole, tout en préservant des capacités de raisonnement, d'alignement, de connaissance, de contexte long et d'agence très convaincantes de son backbone LLM purement textuel, avec une régression marginale ou nulle. Nous publions les points de contrôle (checkpoints) du modèle pour faciliter la recherche ouverte.
English
Audio intelligence involves understanding, reasoning about, and generating both audio and speech. In this work, we introduce Nemotron-Labs-Audex-30B-A3B (Audex), a unified audio-text LLM built on Nemotron-Cascade-2-30B-A3B, a strong text-only MoE LLM. Audex adopts a simple unified design with a single Transformer decoder: audio inputs are encoded and projected into the text embedding space, while text tokens and quantized audio output tokens are treated uniformly during generation. This architecture enables strong audio-text fusion, seamless multimodal generation, and compatibility with standard LLM training and inference infrastructure. For training, we meticulously curate audio-text datasets comprising 157.4B audio tokens and 320.5B text tokens. We apply multi-stage supervised training on these datasets, followed by text-only Cascade RL and multi-domain on-policy distillation. Audex delivers state-of-the-art audio understanding, speech recognition and translation, text-to-speech, audio generation, and speech-to-speech generation, while preserving very compelling reasoning, alignment, knowledge, long-context, and agentic capabilities of its text-only LLM backbone with marginal or no regression. We release the model checkpoints to facilitate open research.