ChatPaper.aiChatPaper

TurnOPD: Destilación On-Policy con Conciencia de Turno para Entrenamiento Eficiente de Agentes en Horizontes Largos

TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

July 7, 2026
Autores: Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen
cs.AI

Resumen

La destilación en política (OPD) entrena una política estudiante mediante la comparación con un docente más fuerte en las propias trayectorias del estudiante, ofreciendo un marco prometedor para el entrenamiento de agentes lingüísticos. Sin embargo, su aplicación a tareas agentivas de largo horizonte sigue siendo insuficientemente explorada. Identificamos dos ineficiencias clave en la OPD de agente básica: (1) los despliegues de horizonte completo suelen desperdiciar tiempo de cómputo en turnos finales que proporcionan una supervisión KL débil y ruidosa, y (2) los objetivos KL a nivel de trayectoria concentran la mayor parte de la pérdida en tokens superficiales, dejando turnos de decisión más profundos subentrenados una vez que los comportamientos iniciales están alineados. Para abordar estos desafíos, proponemos TurnOPD, una estrategia de presupuestación a nivel de turno para la destilación en política eficiente de agentes de largo horizonte. TurnOPD consta de dos controladores de presupuesto: la presupuestación adaptativa de profundidad de despliegue, que utiliza estadísticas de turno basadas en pruebas para determinar la longitud del despliegue, y la presupuestación progresiva de pérdida normalizada por turno, que desplaza gradualmente la ponderación KL desde la supervisión a nivel de token hasta el equilibrio por turno. Los experimentos en ALFWorld, WebShop y Multi-Hop Search con modelos docentes especializados en tareas muestran que TurnOPD logra una precisión de validación superior bajo presupuestos de entrenamiento de tiempo de cómputo iguales y avanza la frontera precisión-tiempo más allá de la OPD básica.
English
On-policy distillation (OPD) trains a student policy by matching a stronger teacher on the student's own trajectories, offering a promising framework for language agent training. However, its application to long-horizon agentic tasks remains insufficiently explored. We identify two key inefficiencies in vanilla agent OPD: (1) full-horizon rollouts often waste wall-clock resources on tail turns that provide weak and noisy KL supervision, and (2) trajectory-level KL objectives concentrate most of the loss on shallow tokens, leaving deeper decision turns under-trained once initial behaviors are aligned. To address these challenges, we propose TurnOPD, a turn-level budgeting strategy for efficient on-policy distillation of long-horizon agents. TurnOPD consists of two budget controllers: adaptive rollout-depth budgeting, which uses probe-based turn statistics to determine rollout length, and progressive turn-normalized loss budgeting, which gradually shifts KL weighting from token-level to turn-balanced supervision. Experiments on ALFWorld, WebShop, and Multi-Hop Search with task-specialized teacher models show that TurnOPD achieves superior validation accuracy under equal wall-clock training budgets and advances the accuracy--time frontier beyond vanilla OPD.