Distillation de politique par région de confiance
Trust Region Policy Distillation
July 6, 2026
Auteurs: Zhengpeng Xie, Li Lyna Zhang, Zeke Xie, Mao Yang
cs.AI
Résumé
Les grands objectifs sont difficiles à atteindre d'un seul coup ; les décomposer en petites étapes est plus judicieux. Nous présentons Trust Region Policy Distillation (TOP-D), qui transforme la Distillation sur Politique (OPD), notoirement instable et à variance élevée, en un paradigme d'entraînement stable en construisant dynamiquement un enseignant proximal. Théoriquement, nous établissons un cadre rigoureux démontrant que TOP-D contrôle intrinsèquement la variance du gradient. En fournissant une analyse formelle de convergence globale accompagnée d'une borne d'amélioration monotone, nous formalisons mathématiquement la fiabilité et la stabilité des dynamiques d'entraînement globales. Empiriquement, TOP-D améliore considérablement la stabilité d'entraînement, l'efficacité d'échantillonnage et les performances finales sur des tâches de raisonnement mathématique. Plus important encore, TOP-D n'introduit aucun surcoût computationnel supplémentaire, se positionnant ainsi comme une alternative prometteuse au paradigme OPD bien établi.
English
Big goals are hard to achieve all at once; breaking them into small steps is wiser. We present Trust Region Policy Distillation (TOP-D), which transforms the notoriously unstable, high-variance On-Policy Distillation (OPD) into a stable training paradigm by dynamically constructing a proximal teacher. Theoretically, we establish a rigorous framework demonstrating that TOP-D inherently controls gradient variance. By providing a formal global convergence analysis alongside a monotonic improvement bound, we mathematically formalize the reliability and stability of the overall training dynamics. Empirically, TOP-D dramatically enhances training stability, sample efficiency, and final performance on mathematical reasoning tasks. More importantly, TOP-D introduces zero additional computational overhead, positioning itself as a promising alternative to the well-established OPD paradigm.