ChatPaper.aiChatPaper

Дистилляция политики в доверительной области

Trust Region Policy Distillation

July 6, 2026
Авторы: Zhengpeng Xie, Li Lyna Zhang, Zeke Xie, Mao Yang
cs.AI

Аннотация

Крупные цели сложно достичь сразу, поэтому разумнее разбивать их на небольшие шаги. Мы представляем метод дистилляции политик с доверительной областью (Trust Region Policy Distillation, TOP-D), который преобразует notoriously нестабильную, высокодисперсионную дистилляцию по текущей политике (On-Policy Distillation, OPD) в стабильную парадигму обучения за счет динамического построения проксимального учителя. Теоретически мы устанавливаем строгую основу, демонстрируя, что TOP-D внутренне контролирует дисперсию градиентов. Предоставляя формальный глобальный анализ сходимости наряду с границей монотонного улучшения, мы математически формализуем надежность и стабильность общей динамики обучения. Эмпирически TOP-D значительно повышает стабильность обучения, эффективность использования выборки и итоговую производительность при решении задач математического рассуждения. Более того, TOP-D вносит нулевые дополнительные вычислительные затраты, позиционируя себя как многообещающую альтернативу устоявшейся парадигме OPD.
English
Big goals are hard to achieve all at once; breaking them into small steps is wiser. We present Trust Region Policy Distillation (TOP-D), which transforms the notoriously unstable, high-variance On-Policy Distillation (OPD) into a stable training paradigm by dynamically constructing a proximal teacher. Theoretically, we establish a rigorous framework demonstrating that TOP-D inherently controls gradient variance. By providing a formal global convergence analysis alongside a monotonic improvement bound, we mathematically formalize the reliability and stability of the overall training dynamics. Empirically, TOP-D dramatically enhances training stability, sample efficiency, and final performance on mathematical reasoning tasks. More importantly, TOP-D introduces zero additional computational overhead, positioning itself as a promising alternative to the well-established OPD paradigm.