ChatPaper.aiChatPaper

Denser is niet beter: Grenzen van on-policy zelfdistillatie voor continue post-training

Denser neq Better: Limits of On-Policy Self-Distillation for Continual Post-Training

July 2, 2026
Auteurs: Meng Wang, Haohan Zhao, Wenzhuo Liu, Lu Yang, Geng Liu, Haiyang Guo, Guo-Sen Xie, Gaofeng Meng, Hongbin Liu, Fei Zhu
cs.AI

Samenvatting

Continue post-training stelt funderingsmodellen in staat om nieuwe kennis te verwerven terwijl bestaande capaciteiten behouden blijven. Recent werk suggereert dat on-policy leren vergeten kan beperken, waarbij on-policy zelfdistillatie naar voren komt als een bijzonder aantrekkelijke benadering. In dit werk heroverwegen we deze optimistische visie door middel van self-distillation policy optimization (SDPO). Onze experimenten tonen aan dat SDPO domeinspecialisatie kan versnellen wanneer lerarensignalen stabiel en goed afgestemd zijn, maar dat het moeite heeft om te generaliseren naar out-of-distribution scenario's. In continue post-training vertoont SDPO sterker vergeten en kan het zelfs instorten, terwijl on-policy reinforcement learning methoden zoals GRPO conservatiever aanpassen en eerdere capaciteiten beter behouden. Verdere analyses onthullen dat dichtere zelfdistillatie grotere verschuivingen veroorzaakt in zowel parameterruimte als responsruimte, en hoogfrequente opmaakartefacten kan versterken via een zelfversterkende leraar-leerling-lus. Deze bevindingen suggereren dat on-policy data alleen onvoldoende is voor continu leren. Dichte zelfdistillatie kan specialisatie versnellen wanneer lerarendoelen stabiel zijn en supervisie op token-niveau betrouwbaar is, maar het moet niet worden behandeld als een standaardstabilisator voor continue post-training. Onze code is beschikbaar op https://github.com/Moenupa/SDPO-CL.
English
Continual post-training enables foundation models to acquire new knowledge while preserving existing capabilities. Recent work suggests that on-policy learning can mitigate forgetting, with on-policy self-distillation emerging as a particularly attractive approach. In this work, we revisit this optimistic view through self-distillation policy optimization (SDPO). Our experiments show that SDPO can accelerate in-domain specialization when teacher signals are stable and well aligned, but it struggles to generalize to out-of-distribution scenarios. In continual post-training, SDPO exhibits stronger forgetting and can even collapse, whereas on-policy reinforcement learning methods such as GRPO adapt more conservatively and better preserve prior capabilities. Further analyses reveal that denser self-distillation induces larger drift in both parameter space and response space, and can amplify high-frequency formatting artifacts through a self-reinforcing teacher--student loop. These findings suggest that on-policy data alone is insufficient for continual learning. Dense self-distillation can accelerate specialization when teacher targets are stable and token-level supervision is reliable, but it should not be treated as a default stabilizer for continual post-training. Our code is available at https://github.com/Moenupa/SDPO-CL.