ChatPaper.aiChatPaper

dOPSD : Auto-distillation sur politique pour modèles de langage à diffusion

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

July 5, 2026
Auteurs: Phuong Tuan Dat, Qi Li, Xinchao Wang
cs.AI

Résumé

Les modèles de langage large par diffusion (dLLMs) génèrent du texte en débruitant itérativement une séquence masquée, offrant une alternative parallèle aux modèles autorégressifs, mais susciter un raisonnement solide par post-entraînement reste difficile : l'ajustement supervisé fin est hors politique et souffre de biais d'exposition, tandis que l'apprentissage par renforcement ne donne que des récompenses clairsemées au niveau de la séquence et est difficile à appliquer sans probabilités de séquence traitables. L'auto-distillation sur politique (OPSD) offre une alternative prometteuse, utilisant un même modèle comme étudiant et enseignant pour fournir une supervision dense au niveau des tokens et sur politique, mais son efficacité repose sur le fait de donner à l'enseignant une information privilégiée (IP) — généralement une référence de vérité terrain spécifique à l'instance indisponible à l'inférence — de sorte que l'étudiant finit par distiller une faible politique de consensus sans IP qui n'apporte que peu d'amélioration au raisonnement des dLLM. Nous introduisons dOPSD, qui tire plutôt le privilège de l'enseignant directement de la propre trajectoire de débruitage de l'étudiant, évaluant les positions masquées à l'aide d'étapes ultérieures plus décodées de cette même trajectoire plutôt que d'une étiquette externe, de sorte que l'avantage de l'enseignant émerge du propre processus de décodage du modèle ; sur Dream et LLaDA, dOPSD améliore à la fois le raisonnement mathématique intra-domaine et la génération de code hors domaine, surpassant les références supervisées et sur politique.
English
Diffusion large language models (dLLMs) generate text by iteratively denoising a masked sequence, offering a parallel alternative to autoregressive models, but eliciting strong reasoning through post-training remains difficult: supervised fine-tuning is off-policy and suffers from exposure bias, while reinforcement learning gives only sparse, sequence-level rewards and is hard to apply without tractable sequence likelihoods. On-policy self-distillation (OPSD) offers a promising alternative, using one model as both student and teacher to provide dense, token-level, on-policy supervision, but its effectiveness hinges on giving the teacher privileged information (PI) - typically an instance-specific ground-truth reference unavailable at inference - so the student ends up distilling a weak PI-free consensus policy that yields little improvement on dLLM reasoning. We introduce dOPSD, which instead derives the teacher's privilege directly from the student's own denoising trajectory, evaluating masked positions using later, more-decoded steps of that same trajectory rather than an external label, so the teacher's advantage emerges from the model's own decoding process; on Dream and LLaDA, dOPSD improves both in-domain math reasoning and out-of-domain code generation, outperforming supervised and on-policy baselines.