ChatPaper.aiChatPaper

dOPSD: Autodestilação On-Policy para Modelos de Linguagem de Difusão

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

July 5, 2026
Autores: Phuong Tuan Dat, Qi Li, Xinchao Wang
cs.AI

Resumo

Modelos de linguagem de grande escala por difusão (dLLMs) geram texto ao remover iterativamente o ruído de uma sequência mascarada, oferecendo uma alternativa paralela aos modelos autorregressivos, mas extrair raciocínio robusto por meio de pós-treinamento continua difícil: o ajuste fino supervisionado é off-policy e sofre de viés de exposição, enquanto o aprendizado por reforço fornece apenas recompensas esparsas em nível de sequência e é difícil de aplicar sem verossimilhanças de sequência tratáveis. A autodestilação on-policy (OPSD) oferece uma alternativa promissora, utilizando um modelo como aluno e professor para fornecer supervisão densa, token a token e on-policy, mas sua eficácia depende da concessão de informação privilegiada (PI) ao professor — tipicamente uma referência de ground-truth específica da instância indisponível na inferência — de modo que o aluno acaba destilando uma política de consenso fraca e sem PI que gera pouca melhoria no raciocínio dos dLLMs. Apresentamos dOPSD, que, em vez disso, deriva o privilégio do professor diretamente da própria trajetória de remoção de ruído do aluno, avaliando posições mascaradas usando etapas posteriores e mais decodificadas dessa mesma trajetória, em vez de um rótulo externo; assim, a vantagem do professor emerge do próprio processo de decodificação do modelo. No Dream e no LLaDA, dOPSD melhora tanto o raciocínio matemático dentro do domínio quanto a geração de código fora do domínio, superando as abordagens de base supervisionadas e on-policy.
English
Diffusion large language models (dLLMs) generate text by iteratively denoising a masked sequence, offering a parallel alternative to autoregressive models, but eliciting strong reasoning through post-training remains difficult: supervised fine-tuning is off-policy and suffers from exposure bias, while reinforcement learning gives only sparse, sequence-level rewards and is hard to apply without tractable sequence likelihoods. On-policy self-distillation (OPSD) offers a promising alternative, using one model as both student and teacher to provide dense, token-level, on-policy supervision, but its effectiveness hinges on giving the teacher privileged information (PI) - typically an instance-specific ground-truth reference unavailable at inference - so the student ends up distilling a weak PI-free consensus policy that yields little improvement on dLLM reasoning. We introduce dOPSD, which instead derives the teacher's privilege directly from the student's own denoising trajectory, evaluating masked positions using later, more-decoded steps of that same trajectory rather than an external label, so the teacher's advantage emerges from the model's own decoding process; on Dream and LLaDA, dOPSD improves both in-domain math reasoning and out-of-domain code generation, outperforming supervised and on-policy baselines.