dOPSD: On-Policy Zelfdistillatie voor Diffusie Taalmodellen
dOPSD: On-Policy Self-Distillation for Diffusion Language Models
July 5, 2026
Auteurs: Phuong Tuan Dat, Qi Li, Xinchao Wang
cs.AI
Samenvatting
Diffusie grote taalmodellen (dLLMs) genereren tekst door iteratief een gemaskeerde reeks te ontruisen, wat een parallel alternatief biedt voor autoregressieve modellen, maar het stimuleren van sterk redeneren via post-training blijft moeilijk: gecontroleerde fijnafstemming is off-policy en lijdt aan blootstellingsbias, terwijl reinforcement learning slechts schaarse beloningen op sequentieniveau geeft en moeilijk toepasbaar is zonder hanteerbare sequentiekansdichtheden. On-policy zelfdistillatie (OPSD) biedt een veelbelovend alternatief, waarbij één model zowel als student als docent fungeert om dichte, token-level, on-policy supervisie te bieden, maar de effectiviteit ervan hangt af van het geven van bevoorrechte informatie (PI) aan de docent – typisch een instantie-specifieke grondwaarheidsreferentie die niet beschikbaar is bij inferentie – zodat de student uiteindelijk een zwak PI-vrij consensusbeleid distilleert dat weinig verbetering oplevert voor dLLM-redeneren. Wij introduceren dOPSD, dat in plaats daarvan het privilege van de docent rechtstreeks afleidt uit de eigen ontruisingsbaan van de student, door gemaskeerde posities te evalueren met behulp van latere, meer-gedecodeerde stappen van diezelfde baan in plaats van een extern label, zodat het voordeel van de docent voortkomt uit het eigen decodeerproces van het model; op Dream en LLaDA verbetert dOPSD zowel het in-domein wiskundig redeneren als de out-of-domain codegeneratie, waarbij het beter presteert dan gecontroleerde en on-policy basislijnen.
English
Diffusion large language models (dLLMs) generate text by iteratively denoising a masked sequence, offering a parallel alternative to autoregressive models, but eliciting strong reasoning through post-training remains difficult: supervised fine-tuning is off-policy and suffers from exposure bias, while reinforcement learning gives only sparse, sequence-level rewards and is hard to apply without tractable sequence likelihoods. On-policy self-distillation (OPSD) offers a promising alternative, using one model as both student and teacher to provide dense, token-level, on-policy supervision, but its effectiveness hinges on giving the teacher privileged information (PI) - typically an instance-specific ground-truth reference unavailable at inference - so the student ends up distilling a weak PI-free consensus policy that yields little improvement on dLLM reasoning. We introduce dOPSD, which instead derives the teacher's privilege directly from the student's own denoising trajectory, evaluating masked positions using later, more-decoded steps of that same trajectory rather than an external label, so the teacher's advantage emerges from the model's own decoding process; on Dream and LLaDA, dOPSD improves both in-domain math reasoning and out-of-domain code generation, outperforming supervised and on-policy baselines.