Zwak-naar-sterk generalisatie via directe on-policy destillatie
Weak-to-Strong Generalization via Direct On-Policy Distillation
July 8, 2026
Auteurs: Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
cs.AI
Samenvatting
Reinforcement learning met verifieerbare beloningen (RLVR) is een krachtige methode om het redeneren van taalmodellen te verbeteren, maar het is duur om dit te herhalen voor elk nieuw sterk model, omdat het doelmodel tijdens training veel rollouts moet genereren. Naarmate modellen schalen, wordt de nabehandeling zelf een knelpunt. Wij bestuderen een alternatief van zwak naar sterk: voer RL uit op een kleiner model waar rollouts goedkoper zijn, en hergebruik vervolgens wat die RL-run heeft geleerd om een sterker doelmodel te verbeteren.
Het direct distilleren van de post-RL zwakke leraar is niet voldoende, omdat het uiteindelijke beleid van de leraar nuttige RL-winsten vermengt met de beperkingen van het kleinere model. Wij stellen Direct On-Policy Distillation (Direct-OPD) voor, dat in plaats daarvan de door RL veroorzaakte beleidsverschuiving van de leraar overdraagt. Direct-OPD vergelijkt de post-RL-leraar met zijn eigen pre-RL-referentie en behandelt hun log-ratio als een dichte impliciete beloning voor de student. In gewone termen vertelt het checkpoint-paar ons welke acties RL meer of minder waarschijnlijk maakte voor het zwakke model, en Direct-OPD past dat signaal toe op de eigen on-policy toestanden van de sterkere student. Dit hergebruikt direct het RL-supervisiesignaal van het zwakke model zonder sparse-reward RL op het doelmodel uit te voeren.
Empirisch gezien maakt Direct-OPD consequent gebruik van zwakkere leraren om sterkere doelmodellen te verbeteren; opvallend is dat het Qwen3-1.7B van 48,3% naar 58,3% op AIME 2024 brengt in slechts 4 uur op 8 A100 GPU's. Het presteert beter dan stapsgewijs gematchte directe RL en maakt de sequentiële samenstelling van meerdere beleidsverschuivingen mogelijk. Onze resultaten tonen aan dat RL-resultaten kunnen worden hergebruikt over modelschalen heen als impliciete beloningssignalen, niet alleen als eindmodellen om te imiteren.
English
Reinforcement learning with verifiable rewards (RLVR) is a powerful recipe for improving language-model reasoning, but it is expensive to repeat on every new strong model because the target model must generate many rollouts during training. As models scale, post-training itself becomes a bottleneck. We study a weak-to-strong alternative: run RL on a smaller model where rollouts are cheaper, then reuse what that RL run learned to improve a stronger target model. Directly distilling the post-RL weak teacher is not enough, because the teacher's final policy mixes useful RL gains with the limitations of the smaller model. We propose Direct On-Policy Distillation (Direct-OPD), which transfers the teacher's RL-induced policy shift instead. Direct-OPD compares the post-RL teacher with its own pre-RL reference and treats their log-ratio as a dense implicit reward for the student. In plain terms, the checkpoint pair tells us which actions RL made the weak model more or less likely to take, and Direct-OPD applies that signal on the stronger student's own on-policy states. This directly reuses the weak model's RL supervision signal without running sparse-reward RL on the target model. Empirically, Direct-OPD consistently leverages weaker teachers to improve stronger target models; notably, it boosts Qwen3-1.7B from 48.3% to 58.3% on AIME 2024 in just 4 hours on 8 A100 GPUs. It outperforms step-matched direct RL and enables the sequential composition of multiple policy shifts. Our results show that RL outcomes can be reused across model scales as implicit reward signals, not merely as final models to imitate.