Generalização Fraca-para-Forte via Destilação On-Policy Direta
Weak-to-Strong Generalization via Direct On-Policy Distillation
July 8, 2026
Autores: Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
cs.AI
Resumo
Aprendizado por reforço com recompensas verificáveis (RLVR) é uma abordagem poderosa para melhorar o raciocínio de modelos de linguagem, mas é caro repeti-la em cada novo modelo forte, pois o modelo alvo deve gerar muitos rollouts durante o treinamento. À medida que os modelos escalam, o pós-treinamento em si se torna um gargalo. Estudamos uma alternativa fraca-para-forte: executar RL em um modelo menor, onde os rollouts são mais baratos, e então reutilizar o que essa execução de RL aprendeu para melhorar um modelo alvo mais forte. Destilar diretamente o professor fraco pós-RL não é suficiente, porque a política final do professor mistura ganhos úteis de RL com as limitações do modelo menor. Propomos a Destilação On-Policy Direta (Direct-OPD), que transfere a mudança de política induzida por RL do professor. O Direct-OPD compara o professor pós-RL com sua própria referência pré-RL e trata a razão logarítmica deles como uma recompensa implícita densa para o estudante. Em termos simples, o par de checkpoints nos informa quais ações o RL tornou mais ou menos prováveis no modelo fraco, e o Direct-OPD aplica esse sinal nos estados on-policy do próprio estudante mais forte. Isso reutiliza diretamente o sinal de supervisão de RL do modelo fraco sem executar RL com recompensas esparsas no modelo alvo. Empiricamente, o Direct-OPD aproveita consistentemente professores mais fracos para melhorar modelos alvo mais fortes; notavelmente, ele eleva o Qwen3-1.7B de 48,3% para 58,3% no AIME 2024 em apenas 4 horas em 8 GPUs A100. Ele supera a RL direta com correspondência de passos e permite a composição sequencial de múltiplas mudanças de política. Nossos resultados mostram que os resultados de RL podem ser reutilizados entre escalas de modelo como sinais de recompensa implícitos, não apenas como modelos finais a serem imitados.
English
Reinforcement learning with verifiable rewards (RLVR) is a powerful recipe for improving language-model reasoning, but it is expensive to repeat on every new strong model because the target model must generate many rollouts during training. As models scale, post-training itself becomes a bottleneck. We study a weak-to-strong alternative: run RL on a smaller model where rollouts are cheaper, then reuse what that RL run learned to improve a stronger target model. Directly distilling the post-RL weak teacher is not enough, because the teacher's final policy mixes useful RL gains with the limitations of the smaller model. We propose Direct On-Policy Distillation (Direct-OPD), which transfers the teacher's RL-induced policy shift instead. Direct-OPD compares the post-RL teacher with its own pre-RL reference and treats their log-ratio as a dense implicit reward for the student. In plain terms, the checkpoint pair tells us which actions RL made the weak model more or less likely to take, and Direct-OPD applies that signal on the stronger student's own on-policy states. This directly reuses the weak model's RL supervision signal without running sparse-reward RL on the target model. Empirically, Direct-OPD consistently leverages weaker teachers to improve stronger target models; notably, it boosts Qwen3-1.7B from 48.3% to 58.3% on AIME 2024 in just 4 hours on 8 A100 GPUs. It outperforms step-matched direct RL and enables the sequential composition of multiple policy shifts. Our results show that RL outcomes can be reused across model scales as implicit reward signals, not merely as final models to imitate.