Destilación de Políticas en Región de Confianza
Trust Region Policy Distillation
July 6, 2026
Autores: Zhengpeng Xie, Li Lyna Zhang, Zeke Xie, Mao Yang
cs.AI
Resumen
Lograr grandes objetivos de una sola vez es difícil; dividirlos en pasos pequeños es más sensato. Presentamos la Destilación de Políticas de Región de Confianza (TOP-D), que transforma la notoriamente inestable y de alta varianza Destilación en Política (OPD) en un paradigma de entrenamiento estable mediante la construcción dinámica de un profesor proximal. Teóricamente, establecemos un marco riguroso que demuestra que TOP-D controla inherentemente la varianza del gradiente. Al proporcionar un análisis formal de convergencia global junto con una cota de mejora monótona, formalizamos matemáticamente la fiabilidad y estabilidad de la dinámica general de entrenamiento. Empíricamente, TOP-D mejora drásticamente la estabilidad del entrenamiento, la eficiencia de muestra y el rendimiento final en tareas de razonamiento matemático. Más importante aún, TOP-D introduce cero sobrecarga computacional adicional, posicionándose como una alternativa prometedora al paradigma OPD bien establecido.
English
Big goals are hard to achieve all at once; breaking them into small steps is wiser. We present Trust Region Policy Distillation (TOP-D), which transforms the notoriously unstable, high-variance On-Policy Distillation (OPD) into a stable training paradigm by dynamically constructing a proximal teacher. Theoretically, we establish a rigorous framework demonstrating that TOP-D inherently controls gradient variance. By providing a formal global convergence analysis alongside a monotonic improvement bound, we mathematically formalize the reliability and stability of the overall training dynamics. Empirically, TOP-D dramatically enhances training stability, sample efficiency, and final performance on mathematical reasoning tasks. More importantly, TOP-D introduces zero additional computational overhead, positioning itself as a promising alternative to the well-established OPD paradigm.