ChatPaper.aiChatPaper

Nemotron-Labs-Difusão: Um Modelo de Linguagem Tri-Modo Unificando Decodificação Autorregressiva, por Difusão e por Auto-Especulação

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

July 7, 2026
Autores: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov
cs.AI

Resumo

Apresentamos o Nemotron-Labs-Diffusion, um modelo de linguagem (ML) de três modos que unifica decodificação AR, difusão e autoespeculação em uma única arquitetura. Treinado com um objetivo conjunto AR-difusão, o Nemotron-Labs-Diffusion pode alternar modos para manter alta produtividade em diferentes configurações de implantação e níveis de concorrência. Nosso estudo mostra que (1) os objetivos AR e de difusão são complementares: a difusão melhora o planejamento antecipado, enquanto a AR fornece prioridades linguísticas da esquerda para a direita. (2) No modo de autoespeculação, a difusão rascunha enquanto a AR verifica, superando os métodos de previsão de múltiplos tokens (MTP) tanto na taxa de aceitação quanto na eficiência em dispositivos reais. (3) Uma análise de velocidade da luz demonstra ainda o potencial de longo prazo da difusão, com até 76,5% mais tokens por passagem direta do que a autoespeculação sob um amostrador ótimo. Escalando para 3B, 8B e 14B parâmetros, nossa família Nemotron-Labs-Diffusion, incluindo modelos base, instruct e visão-linguagem, supera consistentemente os MLs AR e de difusão de código aberto do estado da arte tanto em precisão quanto em velocidade. Por exemplo, o Nemotron-Labs-Diffusion-8B decodifica 6x mais tokens por passagem direta que o Qwen3-8B com precisão comparável, resultando em 4x maior produtividade no SPEED-Bench com SGLang em uma GPU GB200.
English
We introduce Nemotron-Labs-Diffusion, a tri-mode language model (LM) that unifies AR, diffusion, and self-speculation decoding within a single architecture. Trained with a joint AR-diffusion objective, Nemotron-Labs-Diffusion can switch modes to sustain high throughput across deployment settings and concurrency levels. Our study shows that (1) AR and diffusion objectives are complementary: diffusion improves lookahead planning, while AR provides left-to-right linguistic priors. (2) In self-speculation mode, diffusion drafts while AR verifies, outperforming multi-token prediction (MTP) methods in both acceptance rate and real-device efficiency. (3) A speed-of-light analysis further demonstrates diffusion's long-term potential, with up to 76.5% more tokens per forward pass than self-speculation under an optimal sampler. Scaling to 3B, 8B, and 14B parameters, our Nemotron-Labs-Diffusion family, including base, instruct, and vision-language models, consistently outperforms state-of-the-art open-source AR and diffusion LMs in both accuracy and speed. For example, Nemotron-Labs-Diffusion-8B decodes 6x more tokens per forward than Qwen3-8B with comparable accuracy, translating to 4x higher throughput on SPEED-Bench with SGLang on a GB200 GPU.