ChatPaper.aiChatPaper

TurnOPD : Rendre la distillation sur politique consciente des tours pour un entraînement efficace d'agents à long horizon

TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

July 7, 2026
Auteurs: Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen
cs.AI

Résumé

La distillation sur politique (OPD) entraîne une politique étudiante en l’alignant sur un enseignant plus fort lors des trajectoires propres à l’étudiant, offrant ainsi un cadre prometteur pour l’apprentissage des agents langagiers. Cependant, son application aux tâches agentiques à long horizon reste insuffisamment explorée. Nous identifions deux inefficacités clés dans l’OPD agentique standard : (1) les déploiements sur horizon complet gaspillent souvent du temps réel sur les tours finaux qui fournissent une supervision KL faible et bruitée, et (2) les objectifs KL au niveau de la trajectoire concentrent la majeure partie de la perte sur les tokens superficiels, laissant les tours de décision plus profonds sous-entraînés une fois les comportements initiaux alignés. Pour relever ces défis, nous proposons TurnOPD, une stratégie de budgétisation au niveau des tours pour une distillation sur politique efficace des agents à long horizon. TurnOPD comprend deux contrôleurs de budget : un budgétisation adaptative de la profondeur de déploiement, qui utilise des statistiques de tour basées sur des sondes pour déterminer la longueur de déploiement, et un budgétisation progressive normalisée par tour de la perte, qui déplace progressivement la pondération KL d’une supervision au niveau des tokens vers un équilibre par tour. Les expériences sur ALFWorld, WebShop et Multi-Hop Search avec des modèles enseignants spécialisés par tâche montrent que TurnOPD atteint une précision de validation supérieure sous des budgets d’entraînement en temps réel égaux et repousse la frontière précision-temps au-delà de l’OPD standard.
English
On-policy distillation (OPD) trains a student policy by matching a stronger teacher on the student's own trajectories, offering a promising framework for language agent training. However, its application to long-horizon agentic tasks remains insufficiently explored. We identify two key inefficiencies in vanilla agent OPD: (1) full-horizon rollouts often waste wall-clock resources on tail turns that provide weak and noisy KL supervision, and (2) trajectory-level KL objectives concentrate most of the loss on shallow tokens, leaving deeper decision turns under-trained once initial behaviors are aligned. To address these challenges, we propose TurnOPD, a turn-level budgeting strategy for efficient on-policy distillation of long-horizon agents. TurnOPD consists of two budget controllers: adaptive rollout-depth budgeting, which uses probe-based turn statistics to determine rollout length, and progressive turn-normalized loss budgeting, which gradually shifts KL weighting from token-level to turn-balanced supervision. Experiments on ALFWorld, WebShop, and Multi-Hop Search with task-specialized teacher models show that TurnOPD achieves superior validation accuracy under equal wall-clock training budgets and advances the accuracy--time frontier beyond vanilla OPD.