ChatPaper.aiChatPaper

Gradient de Politique Auto-Distillé

Self-Distilled Policy Gradient

June 2, 2026
Auteurs: Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu
cs.AI

Résumé

L'auto-distillation sur politique, où un modèle de langage se conditionne sur un contexte privilégié pour superviser ses propres générations, est une source prometteuse de supervision dense pour l'apprentissage par renforcement à récompenses éparses. En réalité, elle peut être instanciée comme une perte auxiliaire de divergence de Kullback-Leibler inverse étudiant-enseignant sur l'ensemble du vocabulaire. Nous proposons donc SDPG, un cadre d'apprentissage par gradient de politique auto-distillé qui combine les avantages de vérificateur relatifs au groupe avec un écart type normalisé, une auto-distillation sur politique exacte sur l'ensemble du vocabulaire, ainsi qu'une régularisation KL par rapport à la politique de référence. Empiriquement, SDPG améliore la stabilité et les performances par rapport à RLVR et aux méthodes de base d'auto-distillation. Le code est disponible à l'adresse https://github.com/lauyikfung/SDPG.
English
On-policy self-distillation, where a language model conditions on privileged context to supervise its own generations, is a promising source of dense supervision for sparse-reward reinforcement learning. Actually, it can be instantiated as an auxiliary full-vocabulary student-to-teacher reverse Kullback-Leibler divergence loss. We therefore propose SDPG, a self-distilled policy-gradient framework that combines group-relative verifier advantages with normalized standard deviation, exact full-vocabulary on-policy self-distillation, as well as reference-policy KL regularization. Empirically, SDPG improves stability and performance over RLVR and self-distillation baselines. The code is available at https://github.com/lauyikfung/SDPG.