dOPSD: Самодистилляция на основе текущей политики для диффузионных языковых моделей
dOPSD: On-Policy Self-Distillation for Diffusion Language Models
July 5, 2026
Авторы: Phuong Tuan Dat, Qi Li, Xinchao Wang
cs.AI
Аннотация
Диффузионные большие языковые модели (dLLM) генерируют текст путем итеративного устранения шума из маскированной последовательности, предлагая параллельную альтернативу авторегрессионным моделям, однако извлечение сильных рассуждений посредством пост-обучения остается сложной задачей: обучение с учителем является внеполитическим (off-policy) и страдает от экспозиционного смещения (exposure bias), в то время как обучение с подкреплением дает лишь разреженные, последовательно-уровневые награды и трудно применимо без вычислимых правдоподобий последовательностей. Он-политическая само-дистилляция (OPSD) предлагает многообещающую альтернативу, используя одну модель в качестве и ученика, и учителя для обеспечения плотного, токен-уровневого, он-политического контроля, но ее эффективность зависит от предоставления учителю привилегированной информации (PI) — обычно эталонного эталонного результата для конкретного примера, недоступного при инференсе — так что ученик в итоге дистиллирует слабую, лишенную PI консенсусную политику, которая дает мало улучшений в рассуждении dLLM. Мы представляем dOPSD, который вместо этого извлекает привилегию учителя непосредственно из собственной траектории устранения шума ученика, оценивая маскированные позиции с использованием более поздних, более декодированных шагов той же траектории, а не внешней метки, так что преимущество учителя возникает из собственного процесса декодирования модели; на Dream и LLaDA dOPSD улучшает как внутридоменное математическое рассуждение, так и внедоменную генерацию кода, превосходя базовые модели на основе обучения с учителем и он-политические методы.
English
Diffusion large language models (dLLMs) generate text by iteratively denoising a masked sequence, offering a parallel alternative to autoregressive models, but eliciting strong reasoning through post-training remains difficult: supervised fine-tuning is off-policy and suffers from exposure bias, while reinforcement learning gives only sparse, sequence-level rewards and is hard to apply without tractable sequence likelihoods. On-policy self-distillation (OPSD) offers a promising alternative, using one model as both student and teacher to provide dense, token-level, on-policy supervision, but its effectiveness hinges on giving the teacher privileged information (PI) - typically an instance-specific ground-truth reference unavailable at inference - so the student ends up distilling a weak PI-free consensus policy that yields little improvement on dLLM reasoning. We introduce dOPSD, which instead derives the teacher's privilege directly from the student's own denoising trajectory, evaluating masked positions using later, more-decoded steps of that same trajectory rather than an external label, so the teacher's advantage emerges from the model's own decoding process; on Dream and LLaDA, dOPSD improves both in-domain math reasoning and out-of-domain code generation, outperforming supervised and on-policy baselines.