ChatPaper.aiChatPaper

Geïntegreerde audio-intelligentie zonder terugval in tekstintelligentie

Unified Audio Intelligence Without Regressing on Text Intelligence

July 6, 2026
Auteurs: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping
cs.AI

Samenvatting

Audio-intelligentie omvat het begrijpen, redeneren over en genereren van zowel audio als spraak. In dit werk introduceren wij Nemotron-Labs-Audex-30B-A3B (Audex), een universele audio-tekst LLM gebouwd op Nemotron-Cascade-2-30B-A3B, een krachtige tekst-only MoE LLM. Audex hanteert een eenvoudig uniform ontwerp met een enkele Transformer-decoder: audio-ingangen worden gecodeerd en geprojecteerd in de tekst-embeddingruimte, terwijl teksttokens en gekwantiseerde audio-uitvoertokens uniform worden behandeld tijdens de generatie. Deze architectuur maakt sterke audio-tekst fusie, naadloze multimodale generatie en compatibiliteit met standaard LLM-trainings- en inferentie-infrastructuur mogelijk. Voor de training cureren wij zorgvuldig audio-tekst datasets bestaande uit 157,4 miljard audiotokens en 320,5 miljard teksttokens. Wij passen meertraps gesuperviseerde training toe op deze datasets, gevolgd door tekst-only Cascade RL en multidomein on-policy distillatie. Audex levert state-of-the-art audiobegrip, spraakherkenning en -vertaling, tekst-naar-spraak, audiogeneratie en spraak-naar-spraakgeneratie, terwijl het zeer overtuigende redenering, afstemming, kennis, lange-context en agentische capaciteiten van zijn tekst-only LLM-basis behoudt met marginale of geen regressie. Wij stellen de model checkpoints beschikbaar om open onderzoek te faciliteren.
English
Audio intelligence involves understanding, reasoning about, and generating both audio and speech. In this work, we introduce Nemotron-Labs-Audex-30B-A3B (Audex), a unified audio-text LLM built on Nemotron-Cascade-2-30B-A3B, a strong text-only MoE LLM. Audex adopts a simple unified design with a single Transformer decoder: audio inputs are encoded and projected into the text embedding space, while text tokens and quantized audio output tokens are treated uniformly during generation. This architecture enables strong audio-text fusion, seamless multimodal generation, and compatibility with standard LLM training and inference infrastructure. For training, we meticulously curate audio-text datasets comprising 157.4B audio tokens and 320.5B text tokens. We apply multi-stage supervised training on these datasets, followed by text-only Cascade RL and multi-domain on-policy distillation. Audex delivers state-of-the-art audio understanding, speech recognition and translation, text-to-speech, audio generation, and speech-to-speech generation, while preserving very compelling reasoning, alignment, knowledge, long-context, and agentic capabilities of its text-only LLM backbone with marginal or no regression. We release the model checkpoints to facilitate open research.