dOPSD: Autodestilación on-policy para Modelos de Lenguaje de Difusión
dOPSD: On-Policy Self-Distillation for Diffusion Language Models
July 5, 2026
Autores: Phuong Tuan Dat, Qi Li, Xinchao Wang
cs.AI
Resumen
Los modelos de lenguaje grandes de difusión (dLLMs) generan texto eliminando ruido iterativamente de una secuencia enmascarada, ofreciendo una alternativa paralela a los modelos autorregresivos, pero generar un razonamiento sólido mediante el post-entrenamiento sigue siendo difícil: el ajuste fino supervisado está fuera de política y sufre de sesgo de exposición, mientras que el aprendizaje por refuerzo proporciona solo recompensas dispersas a nivel de secuencia y es difícil de aplicar sin verosimilitudes de secuencia tratables. La autodestilación en política (OPSD) ofrece una alternativa prometedora, utilizando un mismo modelo como estudiante y profesor para proporcionar supervisión densa a nivel de token y en política, pero su eficacia depende de otorgar al profesor información privilegiada (PI), típicamente una referencia de verdad fundamental específica de la instancia no disponible en inferencia, por lo que el estudiante termina destilando una política de consenso débil y sin PI que aporta poca mejora en el razonamiento de los dLLMs. Presentamos dOPSD, que en su lugar deriva el privilegio del profesor directamente de la propia trayectoria de eliminación de ruido del estudiante, evaluando las posiciones enmascaradas mediante pasos posteriores y más decodificados de esa misma trayectoria en lugar de una etiqueta externa, de modo que la ventaja del profesor surge del propio proceso de decodificación del modelo; en Dream y LLaDA, dOPSD mejora tanto el razonamiento matemático dentro del dominio como la generación de código fuera del dominio, superando las líneas base supervisadas y en política.
English
Diffusion large language models (dLLMs) generate text by iteratively denoising a masked sequence, offering a parallel alternative to autoregressive models, but eliciting strong reasoning through post-training remains difficult: supervised fine-tuning is off-policy and suffers from exposure bias, while reinforcement learning gives only sparse, sequence-level rewards and is hard to apply without tractable sequence likelihoods. On-policy self-distillation (OPSD) offers a promising alternative, using one model as both student and teacher to provide dense, token-level, on-policy supervision, but its effectiveness hinges on giving the teacher privileged information (PI) - typically an instance-specific ground-truth reference unavailable at inference - so the student ends up distilling a weak PI-free consensus policy that yields little improvement on dLLM reasoning. We introduce dOPSD, which instead derives the teacher's privilege directly from the student's own denoising trajectory, evaluating masked positions using later, more-decoded steps of that same trajectory rather than an external label, so the teacher's advantage emerges from the model's own decoding process; on Dream and LLaDA, dOPSD improves both in-domain math reasoning and out-of-domain code generation, outperforming supervised and on-policy baselines.