Mais denso neq Melhor: Limites da Autodestilação On-Policy para Pós-Treinamento Contínuo
Denser neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training
July 2, 2026
Autores: Meng Wang, Haohan Zhao, Wenzhuo Liu, Lu Yang, Geng Liu, Haiyang Guo, Guo-Sen Xie, Gaofeng Meng, Hongbin Liu, Fei Zhu
cs.AI
Resumo
O pós-treinamento contínuo permite que modelos fundamentais adquiram novos conhecimentos enquanto preservam capacidades existentes. Trabalhos recentes sugerem que o aprendizado on-policy pode mitigar o esquecimento, sendo a autodestilação on-policy uma abordagem particularmente atraente. Neste trabalho, revisitamos essa visão otimista por meio da otimização de políticas com autodestilação (SDPO). Nossos experimentos mostram que o SDPO pode acelerar a especialização no domínio quando os sinais do professor são estáveis e bem alinhados, mas tem dificuldades para generalizar para cenários fora da distribuição. No pós-treinamento contínuo, o SDPO exibe um esquecimento mais forte e pode até colapsar, enquanto métodos de aprendizado por reforço on-policy, como GRPO, adaptam-se de forma mais conservadora e preservam melhor as capacidades anteriores. Análises adicionais revelam que uma autodestilação mais densa induz maior deriva tanto no espaço de parâmetros quanto no espaço de respostas, e pode amplificar artefatos de formatação de alta frequência por meio de um ciclo autorreforçador entre professor e aluno. Esses achados sugerem que apenas dados on-policy são insuficientes para o aprendizado contínuo. A autodestilação densa pode acelerar a especialização quando os alvos do professor são estáveis e a supervisão no nível do token é confiável, mas não deve ser tratada como um estabilizador padrão para o pós-treinamento contínuo. Nosso código está disponível em https://github.com/Moenupa/SDPO-CL.
English
Continual post-training enables foundation models to acquire new knowledge while preserving existing capabilities. Recent work suggests that on-policy learning can mitigate forgetting, with on-policy self-distillation emerging as a particularly attractive approach. In this work, we revisit this optimistic view through self-distillation policy optimization (SDPO). Our experiments show that SDPO can accelerate in-domain specialization when teacher signals are stable and well aligned, but it struggles to generalize to out-of-distribution scenarios. In continual post-training, SDPO exhibits stronger forgetting and can even collapse, whereas on-policy reinforcement learning methods such as GRPO adapt more conservatively and better preserve prior capabilities. Further analyses reveal that denser self-distillation induces larger drift in both parameter space and response space, and can amplify high-frequency formatting artifacts through a self-reinforcing teacher--student loop. These findings suggest that on-policy data alone is insufficient for continual learning. Dense self-distillation can accelerate specialization when teacher targets are stable and token-level supervision is reliable, but it should not be treated as a default stabilizer for continual post-training. Our code is available at https://github.com/Moenupa/SDPO-CL.