ChatPaper.aiChatPaper

Inteligência de Áudio Unificada Sem Regredir na Inteligência de Texto

Unified Audio Intelligence Without Regressing on Text Intelligence

July 6, 2026
Autores: Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping
cs.AI

Resumo

A inteligência de áudio envolve compreensão, raciocínio e geração de áudio e fala. Neste trabalho, apresentamos o Nemotron-Labs-Audex-30B-A3B (Audex), um LLM unificado de áudio-texto construído sobre o Nemotron-Cascade-2-30B-A3B, um LLM MoE robusto exclusivamente textual. O Audex adota um design unificado simples com um único decodificador Transformer: as entradas de áudio são codificadas e projetadas no espaço de embeddings de texto, enquanto tokens de texto e tokens de saída de áudio quantizados são tratados uniformemente durante a geração. Essa arquitetura possibilita uma fusão áudio-texto eficaz, geração multimodal contínua e compatibilidade com infraestruturas padrão de treinamento e inferência de LLMs. Para o treinamento, curadoria meticulosa de conjuntos de dados de áudio-texto totalizando 157,4B tokens de áudio e 320,5B tokens de texto. Aplicamos treinamento supervisionado em múltiplos estágios sobre esses conjuntos, seguido por RL em cascata exclusivamente textual e destilação on-policy multi-domínio. O Audex oferece compreensão de áudio, reconhecimento e tradução de fala, texto-para-fala, geração de áudio e geração de fala-para-fala no estado da arte, ao mesmo tempo que preserva capacidades muito convincentes de raciocínio, alinhamento, conhecimento, contexto longo e agência do seu backbone LLM exclusivamente textual, com regressão marginal ou nula. Disponibilizamos os checkpoints do modelo para facilitar a pesquisa aberta.
English
Audio intelligence involves understanding, reasoning about, and generating both audio and speech. In this work, we introduce Nemotron-Labs-Audex-30B-A3B (Audex), a unified audio-text LLM built on Nemotron-Cascade-2-30B-A3B, a strong text-only MoE LLM. Audex adopts a simple unified design with a single Transformer decoder: audio inputs are encoded and projected into the text embedding space, while text tokens and quantized audio output tokens are treated uniformly during generation. This architecture enables strong audio-text fusion, seamless multimodal generation, and compatibility with standard LLM training and inference infrastructure. For training, we meticulously curate audio-text datasets comprising 157.4B audio tokens and 320.5B text tokens. We apply multi-stage supervised training on these datasets, followed by text-only Cascade RL and multi-domain on-policy distillation. Audex delivers state-of-the-art audio understanding, speech recognition and translation, text-to-speech, audio generation, and speech-to-speech generation, while preserving very compelling reasoning, alignment, knowledge, long-context, and agentic capabilities of its text-only LLM backbone with marginal or no regression. We release the model checkpoints to facilitate open research.