Modelos de Difusão de Linguagem de Grande Escala Aprimorados
Improved Large Language Diffusion Models
June 24, 2026
Autores: Shen Nie, Qiyang Min, Shaoxuan Xu, Zihao Huang, Yuxuan Song, Yong Shan, Yankai Lin, Wayne Xin Zhao, Chongxuan Li, Ji-Rong Wen
cs.AI
Resumo
Modelos de linguagem de grande escala modernos são predominantemente treinados com fatoração autorregressiva e atenção causal. Apresentamos o iLLaDA, um modelo de linguagem de difusão mascarada de 8B treinado do zero com atenção totalmente bidirecional. O iLLaDA mantém o objetivo de difusão mascarada durante todo o pré-treinamento e ajuste fino supervisionado (SFT), escalando o pré-treinamento para 12T tokens e o ajuste fino em um corpus de instruções de 25B tokens por 12 épocas. Além disso, utilizamos geração de comprimento variável para eficiência e introduzimos pontuação baseada em confiança para avaliação de múltipla escolha. Comparado ao LLaDA, o iLLaDA melhora amplamente em benchmarks gerais, matemáticos e de código; por exemplo, o iLLaDA-Base melhora em 21,6 pontos no BBH e 14,9 pontos no ARC-Challenge, enquanto o iLLaDA-Instruct melhora em 14,5 pontos no MATH e 16,5 pontos no HumanEval. Apesar de seu treinamento não autorregressivo, o iLLaDA também permanece competitivo com o Qwen2.5 7B em vários benchmarks. Esses resultados mostram que o treinamento de difusão totalmente bidirecional do zero é um caminho competitivo para modelos de linguagem robustos. Pesos e códigos do modelo: https://github.com/ML-GSAI/LLaDA.
English
Modern large language models are predominantly trained with autoregressive factorization and causal attention. We present iLLaDA, an 8B masked diffusion language model trained from scratch with fully bidirectional attention. iLLaDA keeps the masked diffusion objective throughout pre-training and supervised fine-tuning (SFT), scaling pre-training to 12T tokens and fine-tuning on a 25B-token instruction corpus for 12 epochs. We further use variable-length generation for efficiency and introduce confidence-based scoring for multiple-choice evaluation. Compared with LLaDA, iLLaDA improves broadly across general, mathematical, and code benchmarks; for example, iLLaDA-Base improves by 21.6 points on BBH and 14.9 points on ARC-Challenge, while iLLaDA-Instruct improves by 14.5 points on MATH and 16.5 points on HumanEval. Despite its non-autoregressive training, iLLaDA also remains competitive with Qwen2.5 7B on several benchmarks. These results show that fully bidirectional diffusion training from scratch is a competitive path toward strong language models. Model weights and codes: https://github.com/ML-GSAI/LLaDA.