ChatPaper.aiChatPaper

TurnOPD: дистилляция на политике с учетом шагов для эффективного обучения агента с длинным горизонтом

TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

July 7, 2026
Авторы: Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen
cs.AI

Аннотация

Дистилляция на политике (OPD) обучает политику студента путем согласования с более сильным учителем на собственных траекториях студента, что представляет собой перспективный фреймворк для обучения языковых агентов. Однако ее применение к долгосрочным агентным задачам остается недостаточно изученным. Мы выявляем две ключевые неэффективности стандартной агентной OPD: (1) прогоны на полном горизонте часто тратят ресурсы реального времени на хвостовые шаги, которые дают слабый и зашумленный KL-надзор, и (2) KL-цели на уровне траектории концентрируют большую часть потерь на поверхностных токенах, оставляя более глубокие шаги принятия решений недообученными после согласования начального поведения. Для решения этих проблем мы предлагаем TurnOPD — стратегию бюджетирования на уровне шагов для эффективной дистилляции на политике долгосрочных агентов. TurnOPD состоит из двух контроллеров бюджета: адаптивного бюджетирования глубины прогонов, которое использует статистику шагов на основе зондов для определения длины прогона, и прогрессивного бюджетирования потерь, нормализованных по шагам, которое постепенно смещает KL-взвешивание с надзора на уровне токенов к сбалансированному по шагам надзору. Эксперименты на ALFWorld, WebShop и Multi-Hop Search с моделями учителей, специализированными под задачу, показывают, что TurnOPD достигает превосходной точности валидации при равных бюджетах обучения в реальном времени и продвигает границу точности-времени за пределы стандартной OPD.
English
On-policy distillation (OPD) trains a student policy by matching a stronger teacher on the student's own trajectories, offering a promising framework for language agent training. However, its application to long-horizon agentic tasks remains insufficiently explored. We identify two key inefficiencies in vanilla agent OPD: (1) full-horizon rollouts often waste wall-clock resources on tail turns that provide weak and noisy KL supervision, and (2) trajectory-level KL objectives concentrate most of the loss on shallow tokens, leaving deeper decision turns under-trained once initial behaviors are aligned. To address these challenges, we propose TurnOPD, a turn-level budgeting strategy for efficient on-policy distillation of long-horizon agents. TurnOPD consists of two budget controllers: adaptive rollout-depth budgeting, which uses probe-based turn statistics to determine rollout length, and progressive turn-normalized loss budgeting, which gradually shifts KL weighting from token-level to turn-balanced supervision. Experiments on ALFWorld, WebShop, and Multi-Hop Search with task-specialized teacher models show that TurnOPD achieves superior validation accuracy under equal wall-clock training budgets and advances the accuracy--time frontier beyond vanilla OPD.