DOPD: Destilação On-policy Dual
DOPD: Dual On-policy Distillation
June 29, 2026
Autores: Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan
cs.AI
Resumo
A destilação on-policy (OPD) oferece transferência superior de capacidade ao supervisionar trajetórias amostradas pelo aluno com sinais densos em nível de token. Para fornecer fontes de supervisão de alta qualidade e, assim, elevar a fronteira de desempenho da destilação, uma direção intuitiva é infundir informações privilegiadas ao professor ou ao próprio aluno. No entanto, essa entrada adicional induz um modo de falha potencial que denominamos ilusão de privilégio: um padrão que confunde a lacuna de capacidade transferível que os alunos devem fechar e a lacuna de assimetria de informação que só pode ser imitada, nunca replicada. Essa questão é ainda amplificada pela não uniformidade inerente da supervisão em nível de token, onde apenas um pequeno subconjunto de tokens carrega sinais cruciais de capacidade. Para isso, propomos DOPD, um paradigma de destilação dupla ciente de vantagem que roteia dinamicamente a supervisão em nível de token entre políticas de professor privilegiado e aluno privilegiado com base em sua lacuna de vantagem e probabilidades relativas. Cada token recebe supervisão de diferentes intensidades, objetivos e estratégias, seja do professor ou do próprio aluno, o que transfere capacidade confiável enquanto simultaneamente recebe sinais auxiliares, para aliviar a ilusão de privilégio. Experimentos extensivos em configurações de modelo de linguagem de grande porte (LLM) e modelo visão-linguagem (VLM) demonstram que DOPD supera consistentemente a OPD vanilla e outras contrapartes. Resultados adicionais em estabilidade, robustez, aprendizado contínuo e tarefas fora da distribuição validam sua superioridade.
English
On-policy distillation (OPD) offers superior capacity transfer by supervising student-sampled trajectories with dense token-level signals. To furnish high-quality supervision sources and thereby elevate the performance frontier of distillation, an intuitive direction is to infuse privileged information to either teacher or student itself. However, this additional input induces a potential failure mode we dub privilege illusion: a pattern that conflates the transferable capability gap that students are meant to close, and the information asymmetry gap that can only be mimicked but never replicated. This issue is further amplified by the inherent non-uniformity of token-level supervision, where only a small subset of tokens carries pivotal capability-bearing signals. To this end, we propose DOPD, an advantage-aware dual distillation paradigm that dynamically routes token-level supervision between privileged teacher and privileged student policies based on their advantage gap and relative probabilities. Each token receives supervision of different strength, objective, and strategy from either teacher or student itself, which transfers credible capability while simultaneously receiving auxiliary signals, to alleviate privilege illusion. Extensive experiments on both large language model (LLM) and vision-language model (VLM) settings demonstrate that DOPD consistently outperforms Vanilla OPD and other counterparts. Further results on stability, robustness, continual learning, and out-of-distribution tasks validate its superiority.