Обобщение от слабого к сильному через прямую дистилляцию по текущей политике

Weak-to-Strong Generalization via Direct On-Policy Distillation

July 8, 2026
Авторы: Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
cs.AI

Аннотация

Обучение с подкреплением на основе проверяемых вознаграждений (RLVR) — это мощный метод улучшения рассуждений языковых моделей, однако он дорогостоящ при повторении на каждой новой сильной модели, поскольку целевая модель должна генерировать множество прогонов в ходе обучения. По мере масштабирования моделей само пост-обучение становится узким местом. Мы исследуем альтернативу «от слабого к сильному»: запускаем RL на меньшей модели, где прогоны дешевле, а затем используем результаты этого RL для улучшения более сильной целевой модели. Прямая дистилляция слабого учителя после RL недостаточна, так как итоговая политика учителя смешивает полезные достижения RL с ограничениями меньшей модели. Мы предлагаем прямую онлайн-дистилляцию (Direct-OPD), которая переносит сдвиг политики, вызванный RL у учителя. Direct-OPD сравнивает учителя после RL с его же эталоном до RL и использует их лог-отношение как плотное неявное вознаграждение для ученика. Проще говоря, пара контрольных точек показывает, какие действия RL сделал для слабой модели более или менее вероятными, и Direct-OPD применяет этот сигнал на собственных онлайн-состояниях более сильного ученика. Это позволяет напрямую использовать сигнал наблюдения RL от слабой модели без запуска RL с разреженным вознаграждением на целевой модели. Эмпирически Direct-OPD последовательно использует более слабых учителей для улучшения более сильных целевых моделей; в частности, она повышает результат Qwen3-1.7B с 48,3% до 58,3% на AIME 2024 всего за 4 часа на 8 GPU A100. Метод превосходит прямой RL с попарным выравниванием шагов и позволяет последовательно комбинировать несколько сдвигов политики. Наши результаты показывают, что результаты RL можно повторно использовать между масштабами моделей в виде сигналов неявного вознаграждения, а не только как финальные модели для имитации.
English
Reinforcement learning with verifiable rewards (RLVR) is a powerful recipe for improving language-model reasoning, but it is expensive to repeat on every new strong model because the target model must generate many rollouts during training. As models scale, post-training itself becomes a bottleneck. We study a weak-to-strong alternative: run RL on a smaller model where rollouts are cheaper, then reuse what that RL run learned to improve a stronger target model. Directly distilling the post-RL weak teacher is not enough, because the teacher's final policy mixes useful RL gains with the limitations of the smaller model. We propose Direct On-Policy Distillation (Direct-OPD), which transfers the teacher's RL-induced policy shift instead. Direct-OPD compares the post-RL teacher with its own pre-RL reference and treats their log-ratio as a dense implicit reward for the student. In plain terms, the checkpoint pair tells us which actions RL made the weak model more or less likely to take, and Direct-OPD applies that signal on the stronger student's own on-policy states. This directly reuses the weak model's RL supervision signal without running sparse-reward RL on the target model. Empirically, Direct-OPD consistently leverages weaker teachers to improve stronger target models; notably, it boosts Qwen3-1.7B from 48.3% to 58.3% on AIME 2024 in just 4 hours on 8 A100 GPUs. It outperforms step-matched direct RL and enables the sequential composition of multiple policy shifts. Our results show that RL outcomes can be reused across model scales as implicit reward signals, not merely as final models to imitate.
PDF932July 15, 2026