ChatPaper.aiChatPaper

Nemotron-Labs-Diffusion: трехрежимная языковая модель, объединяющая авторегрессивное, диффузионное и само-спекулятивное декодирование

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

July 7, 2026
Авторы: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov
cs.AI

Аннотация

Мы представляем Nemotron-Labs-Diffusion — трёхрежимную языковую модель (ЯМ), объединяющую в рамках единой архитектуры авторегрессионное (AR) декодирование, диффузионное декодирование и самоспекулятивное декодирование. Обученная с помощью совместной AR-диффузионной целевой функции, Nemotron-Labs-Diffusion способна переключать режимы для поддержания высокой пропускной способности в различных сценариях развёртывания и при разных уровнях параллелизма. Наше исследование показывает, что (1) AR и диффузионная цели взаимодополняют друг друга: диффузия улучшает планирование с упреждением, в то время как AR предоставляет лингвистические априорные знания слева направо. (2) В режиме самоспекуляции диффузия генерирует черновик, а AR выполняет верификацию, превосходя методы многотокенного предсказания (MTP) как по уровню принятия, так и по эффективности на реальном устройстве. (3) Анализ, проведённый по принципу «скорости света», дополнительно демонстрирует долгосрочный потенциал диффузии: при использовании оптимального сэмплера она выдаёт до 76,5% больше токенов за один прямой проход по сравнению с самоспекуляцией. При масштабировании до 3, 8 и 14 миллиардов параметров семейство моделей Nemotron-Labs-Diffusion, включающее базовые, инструктивные и визуально-языковые версии, неизменно превосходит современные открытые AR и диффузионные ЯМ как по точности, так и по скорости. Например, модель Nemotron-Labs-Diffusion-8B декодирует в 6 раз больше токенов за прямой проход, чем Qwen3-8B, при сопоставимой точности, что приводит к 4-кратному увеличению пропускной способности на тесте SPEED-Bench при использовании SGLang на графическом процессоре GB200.
English
We introduce Nemotron-Labs-Diffusion, a tri-mode language model (LM) that unifies AR, diffusion, and self-speculation decoding within a single architecture. Trained with a joint AR-diffusion objective, Nemotron-Labs-Diffusion can switch modes to sustain high throughput across deployment settings and concurrency levels. Our study shows that (1) AR and diffusion objectives are complementary: diffusion improves lookahead planning, while AR provides left-to-right linguistic priors. (2) In self-speculation mode, diffusion drafts while AR verifies, outperforming multi-token prediction (MTP) methods in both acceptance rate and real-device efficiency. (3) A speed-of-light analysis further demonstrates diffusion's long-term potential, with up to 76.5% more tokens per forward pass than self-speculation under an optimal sampler. Scaling to 3B, 8B, and 14B parameters, our Nemotron-Labs-Diffusion family, including base, instruct, and vision-language models, consistently outperforms state-of-the-art open-source AR and diffusion LMs in both accuracy and speed. For example, Nemotron-Labs-Diffusion-8B decodes 6x more tokens per forward than Qwen3-8B with comparable accuracy, translating to 4x higher throughput on SPEED-Bench with SGLang on a GB200 GPU.