AsyncOPD: Hoe verouderd kan on-policy distillatie zijn?
AsyncOPD: How Stale Can On-Policy Distillation Be?
June 23, 2026
Auteurs: Wonjun Kang, Kevin Galim, Seunghyuk Oh, Minjun Kang, Sanghyun Park, Donghoon Kim, Minjae Lee, Minseo Kim, Rishabh Tiwari, Yuchen Zeng, Hyung Il Koo, Kangwook Lee
cs.AI
Samenvatting
On-policy distillatie (OPD) traint een student op zijn eigen rollouts, begeleid door feedback van de leraar, en wordt steeds belangrijker voor de natraining van grote taalmodellen (LLM). Net als reinforcement learning (RL) kampt OPD echter met een on-policy systeemknelpunt, omdat rollouts de trainingstijd voor redeneerworkloads kunnen domineren. Asynchrone trainingspijplijnen kunnen dit knelpunt verlichten door rolloutgeneratie te ontkoppelen van lerende updates, maar dit introduceert verouderde-beleidsgegevens. Hoewel eerder werk verouderde gegevens in asynchroon RL heeft bestudeerd, blijven de effecten ervan in OPD onderbelicht. We presenteren de eerste systematische studie van veroudering in asynchrone OPD, gericht op een praktische setting waarin feedback van de leraar wordt geïmplementeerd via lokale KL-verliezen en volledige-woordenschat leraar-logits te duur zijn om op te slaan of over te dragen, wat eindige leraar-score caches noodzakelijk maakt. We tonen eerst aan dat KL-richting het verouderde-gegevensprobleem verandert: leraar-gewogen voorwaartse KL is robuuster tegen verouderde rollouts, terwijl student-gewogen omgekeerde KL kwetsbaar is. Ten tweede bestuderen we voor dit kwetsbare omgekeerde-KL-geval of methoden die zijn ontworpen om asynchroon RL te stabiliseren OPD-veroudering kunnen verminderen. In onze experimenten verbeteren ze niet ten opzichte van een eenvoudiger OPD-specifiek surrogaat: het herberekenen van het omgekeerde-KL-signaal onder de huidige student op het moment van leren. Ten derde analyseren we hoe eindige leraar-score caches een afweging tussen bias en variantie creëren voor schaarse en gesamplede omgekeerde-KL OPD-schatters. Dit motiveert meervoudige-steekproef Monte Carlo (MC), dat MC-corrigeerbaarheid behoudt terwijl de variantie van één steekproef wordt verminderd. Tot slot presenteren en open-sourcen we AsyncOPD, een volledig asynchrone OPD-trainingspijplijn gebouwd op basis van deze schatterskeuzes. Experimenten tonen aan dat AsyncOPD de trainingsdoorvoer met 1,6 tot 3,8 keer verbetert ten opzichte van strikt synchrone training, terwijl het een vergelijkbare nauwkeurigheid bereikt.
English
On-policy distillation (OPD) trains a student on its own rollouts guided by teacher feedback and is becoming increasingly important for large language model (LLM) post-training. Like reinforcement learning (RL), however, OPD faces an on-policy systems bottleneck, as rollouts can dominate training time for reasoning workloads. Asynchronous training pipelines can alleviate this bottleneck by decoupling rollout generation from learner updates, but doing so introduces stale-policy data. While prior work has studied stale data in asynchronous RL, its effects in OPD remain underexplored. We present the first systematic study of staleness in asynchronous OPD, focusing on a practical setting where teacher feedback is implemented through local KL losses and full-vocabulary teacher logits are too expensive to store or transfer, necessitating finite teacher-score caches. We first show that KL direction changes the stale-data problem: teacher-weighted forward KL is more robust to stale rollouts, whereas student-weighted reverse KL is vulnerable. Second, for this vulnerable reverse-KL case, we study whether methods designed to stabilize asynchronous RL can mitigate OPD staleness. In our experiments, they do not improve over a simpler OPD-specific surrogate: recomputing the reverse-KL signal under the current student at learner time. Third, we analyze how finite teacher-score caches create a bias-variance tradeoff for sparse and sampled reverse-KL OPD estimators. This motivates multi-sample Monte Carlo (MC), which preserves MC correctability while reducing one-sample variance. Finally, we present and open-source AsyncOPD, a fully asynchronous OPD training pipeline built from these estimator choices. Experiments show that AsyncOPD improves training throughput by 1.6times to 3.8times over strict synchronous training while reaching comparable accuracy.