Nemotron-Labs-Diffusion: Un modelo de lenguaje trimodal que unifica la decodificación autorregresiva, de difusión y de autoespeculación
Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding
July 7, 2026
Autores: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov
cs.AI
Resumen
Presentamos Nemotron-Labs-Diffusion, un modelo de lenguaje (LM) tri-modal que unifica la decodificación AR (autorregresiva), por difusión y por autoespeculación en una única arquitectura. Entrenado con un objetivo conjunto AR-difusión, Nemotron-Labs-Diffusion puede alternar modos para mantener un alto rendimiento en distintos entornos de despliegue y niveles de concurrencia. Nuestro estudio muestra que: (1) los objetivos AR y de difusión son complementarios: la difusión mejora la planificación anticipada, mientras que AR proporciona priors lingüísticos de izquierda a derecha. (2) En modo de autoespeculación, la difusión genera borradores mientras que AR los verifica, superando a los métodos de predicción multietiqueta (MTP) tanto en tasa de aceptación como en eficiencia en dispositivos reales. (3) Un análisis de velocidad de la luz demuestra además el potencial a largo plazo de la difusión, con hasta un 76,5% más de tokens por paso forward que la autoespeculación bajo un muestreador óptimo. Escalando a 3B, 8B y 14B parámetros, nuestra familia Nemotron-Labs-Diffusion, que incluye modelos base, de instrucción y de visión-lenguaje, supera consistentemente a los LM AR y de difusión de código abierto más avanzados tanto en precisión como en velocidad. Por ejemplo, Nemotron-Labs-Diffusion-8B decodifica 6 veces más tokens por paso forward que Qwen3-8B con una precisión comparable, lo que se traduce en un rendimiento 4 veces mayor en SPEED-Bench con SGLang en una GPU GB200.
English
We introduce Nemotron-Labs-Diffusion, a tri-mode language model (LM) that unifies AR, diffusion, and self-speculation decoding within a single architecture. Trained with a joint AR-diffusion objective, Nemotron-Labs-Diffusion can switch modes to sustain high throughput across deployment settings and concurrency levels. Our study shows that (1) AR and diffusion objectives are complementary: diffusion improves lookahead planning, while AR provides left-to-right linguistic priors. (2) In self-speculation mode, diffusion drafts while AR verifies, outperforming multi-token prediction (MTP) methods in both acceptance rate and real-device efficiency. (3) A speed-of-light analysis further demonstrates diffusion's long-term potential, with up to 76.5% more tokens per forward pass than self-speculation under an optimal sampler. Scaling to 3B, 8B, and 14B parameters, our Nemotron-Labs-Diffusion family, including base, instruct, and vision-language models, consistently outperforms state-of-the-art open-source AR and diffusion LMs in both accuracy and speed. For example, Nemotron-Labs-Diffusion-8B decodes 6x more tokens per forward than Qwen3-8B with comparable accuracy, translating to 4x higher throughput on SPEED-Bench with SGLang on a GB200 GPU.