Généralisation faible-à-forte via distillation directe sur politique
Weak-to-Strong Generalization via Direct On-Policy Distillation
July 8, 2026
Auteurs: Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
cs.AI
Résumé
L’apprentissage par renforcement avec récompenses vérifiables (RLVR) est une méthode puissante pour améliorer le raisonnement des modèles de langage, mais il est coûteux de répéter cette approche sur chaque nouveau modèle performant, car le modèle cible doit générer de nombreux rollouts pendant l’entraînement. À mesure que les modèles s’agrandissent, le post-entraînement lui-même devient un goulot d’étranglement. Nous étudions une alternative faible-à-forte : exécuter l’apprentissage par renforcement sur un modèle plus petit, où les rollouts sont moins coûteux, puis réutiliser ce que cet apprentissage a appris pour améliorer un modèle cible plus fort. Distiller directement l’enseignant faible post-AR ne suffit pas, car la politique finale de l’enseignant mélange les gains utiles de l’apprentissage par renforcement avec les limites du modèle plus petit. Nous proposons la distillation directe sur politique (Direct-OPD), qui transfère le déplacement de politique induit par l’apprentissage par renforcement chez l’enseignant. Direct-OPD compare l’enseignant post-AR avec sa propre référence pré-AR et traite leur rapport logarithmique comme une récompense implicite dense pour l’étudiant. En termes simples, la paire de points de contrôle nous indique quelles actions l’apprentissage par renforcement a rendues plus ou moins probables pour le modèle faible, et Direct-OPD applique ce signal sur les états on-policy de l’étudiant plus fort. Cela réutilise directement le signal de supervision de l’apprentissage par renforcement du modèle faible sans exécuter d’AR à récompense rare sur le modèle cible. Empiriquement, Direct-OPD exploite systématiquement des enseignants plus faibles pour améliorer des modèles cibles plus forts ; notamment, il fait passer Qwen3-1.7B de 48,3 % à 58,3 % sur AIME 2024 en seulement 4 heures sur 8 GPU A100. Il surpasse l’AR direct apparié par étapes et permet la composition séquentielle de multiples déplacements de politique. Nos résultats montrent que les résultats de l’apprentissage par renforcement peuvent être réutilisés à travers les échelles de modèles comme des signaux de récompense implicites, et non simplement comme des modèles finaux à imiter.
English
Reinforcement learning with verifiable rewards (RLVR) is a powerful recipe for improving language-model reasoning, but it is expensive to repeat on every new strong model because the target model must generate many rollouts during training. As models scale, post-training itself becomes a bottleneck. We study a weak-to-strong alternative: run RL on a smaller model where rollouts are cheaper, then reuse what that RL run learned to improve a stronger target model. Directly distilling the post-RL weak teacher is not enough, because the teacher's final policy mixes useful RL gains with the limitations of the smaller model. We propose Direct On-Policy Distillation (Direct-OPD), which transfers the teacher's RL-induced policy shift instead. Direct-OPD compares the post-RL teacher with its own pre-RL reference and treats their log-ratio as a dense implicit reward for the student. In plain terms, the checkpoint pair tells us which actions RL made the weak model more or less likely to take, and Direct-OPD applies that signal on the stronger student's own on-policy states. This directly reuses the weak model's RL supervision signal without running sparse-reward RL on the target model. Empirically, Direct-OPD consistently leverages weaker teachers to improve stronger target models; notably, it boosts Qwen3-1.7B from 48.3% to 58.3% on AIME 2024 in just 4 hours on 8 A100 GPUs. It outperforms step-matched direct RL and enables the sequential composition of multiple policy shifts. Our results show that RL outcomes can be reused across model scales as implicit reward signals, not merely as final models to imitate.