TurnOPD: Tornando a Destilação On-Policy Ciente de Turnos para Treinamento Eficiente de Agentes de Longo Horizonte
TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
July 7, 2026
Autores: Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen
cs.AI
Resumo
A destilação on-policy (OPD) treina uma política estudante ao alinhar um professor mais forte nas trajetórias do próprio estudante, oferecendo uma estrutura promissora para o treinamento de agentes linguísticos. No entanto, sua aplicação a tarefas agentivas de longo horizonte ainda é insuficientemente explorada. Identificamos duas ineficiências-chave na OPD vanilla para agentes: (1) _rollouts_ de horizonte completo frequentemente desperdiçam recursos de tempo real em turnos finais que fornecem supervisão KL fraca e ruidosa, e (2) objetivos KL no nível da trajetória concentram a maior parte da perda em tokens rasos, deixando turnos de decisão mais profundos subtreinados uma vez que os comportamentos iniciais são alinhados. Para lidar com esses desafios, propomos TurnOPD, uma estratégia de orçamentação no nível do turno para destilação on-policy eficiente de agentes de longo horizonte. TurnOPD consiste em dois controladores de orçamento: orçamentação adaptativa da profundidade do _rollout_, que usa estatísticas de turno baseadas em sonda para determinar o comprimento do _rollout_, e orçamentação progressiva da perda normalizada por turno, que gradualmente desloca a ponderação KL da supervisão no nível do token para um equilíbrio centrado no turno. Experimentos em ALFWorld, WebShop e Multi-Hop Search com modelos professores especializados em tarefas mostram que TurnOPD alcança precisão de validação superior sob orçamentos iguais de tempo real de treinamento e avança a fronteira precisão-tempo além da OPD vanilla.
English
On-policy distillation (OPD) trains a student policy by matching a stronger teacher on the student's own trajectories, offering a promising framework for language agent training. However, its application to long-horizon agentic tasks remains insufficiently explored. We identify two key inefficiencies in vanilla agent OPD: (1) full-horizon rollouts often waste wall-clock resources on tail turns that provide weak and noisy KL supervision, and (2) trajectory-level KL objectives concentrate most of the loss on shallow tokens, leaving deeper decision turns under-trained once initial behaviors are aligned. To address these challenges, we propose TurnOPD, a turn-level budgeting strategy for efficient on-policy distillation of long-horizon agents. TurnOPD consists of two budget controllers: adaptive rollout-depth budgeting, which uses probe-based turn statistics to determine rollout length, and progressive turn-normalized loss budgeting, which gradually shifts KL weighting from token-level to turn-balanced supervision. Experiments on ALFWorld, WebShop, and Multi-Hop Search with task-specialized teacher models show that TurnOPD achieves superior validation accuracy under equal wall-clock training budgets and advances the accuracy--time frontier beyond vanilla OPD.