TurnOPD: Het beurtbewust maken van on-beleid distillatie voor efficiënte training van agenten met lange horizon
TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
July 7, 2026
Auteurs: Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen
cs.AI
Samenvatting
On-policy distillatie (OPD) traint een studentenbeleid door een sterkere leraar te matchen op de eigen trajecten van de student, wat een veelbelovend raamwerk biedt voor het trainen van taalagenten. De toepassing ervan op langetermijn-agenttaken blijft echter onvoldoende onderzocht. We identificeren twee belangrijke inefficiënties in vanilla agent OPD: (1) volledige-horizon rollouts verspillen vaak wandklokresources aan staartbeurten die zwakke en ruizige KL-supervisie bieden, en (2) trajectniveau KL-doelstellingen concentreren het grootste deel van het verlies op ondiepe tokens, waardoor diepere beslissingsbeurten ondergetraind blijven zodra initiële gedragingen zijn afgestemd. Om deze uitdagingen aan te pakken, stellen we TurnOPD voor, een beurtniveaubudgetteringsstrategie voor efficiënte on-policy distillatie van langetermijnagenten. TurnOPD bestaat uit twee budgetcontroleurs: adaptieve rollout-dieptebudgettering, die op probes gebaseerde beurtstatistieken gebruikt om de roll-outlengte te bepalen, en progressieve beurtgenormaliseerde verliesbudgettering, die geleidelijk de KL-weging verschuift van token-niveau naar beurtgebalanceerde supervisie. Experimenten op ALFWorld, WebShop en Multi-Hop Search met taakgespecialiseerde leraarmodellen tonen aan dat TurnOPD superieure validatienauwkeurigheid behaalt onder gelijke wandkloktrainingsbudgetten en de nauwkeurigheid-tijdgrens voorbij vanilla OPD verlegt.
English
On-policy distillation (OPD) trains a student policy by matching a stronger teacher on the student's own trajectories, offering a promising framework for language agent training. However, its application to long-horizon agentic tasks remains insufficiently explored. We identify two key inefficiencies in vanilla agent OPD: (1) full-horizon rollouts often waste wall-clock resources on tail turns that provide weak and noisy KL supervision, and (2) trajectory-level KL objectives concentrate most of the loss on shallow tokens, leaving deeper decision turns under-trained once initial behaviors are aligned. To address these challenges, we propose TurnOPD, a turn-level budgeting strategy for efficient on-policy distillation of long-horizon agents. TurnOPD consists of two budget controllers: adaptive rollout-depth budgeting, which uses probe-based turn statistics to determine rollout length, and progressive turn-normalized loss budgeting, which gradually shifts KL weighting from token-level to turn-balanced supervision. Experiments on ALFWorld, WebShop, and Multi-Hop Search with task-specialized teacher models show that TurnOPD achieves superior validation accuracy under equal wall-clock training budgets and advances the accuracy--time frontier beyond vanilla OPD.