Generalización de débil a fuerte vía destilación directa on-policy

Weak-to-Strong Generalization via Direct On-Policy Distillation

July 8, 2026
Autores: Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
cs.AI

Resumen

El aprendizaje por refuerzo con recompensas verificables (RLVR) es una estrategia poderosa para mejorar el razonamiento de los modelos de lenguaje, pero resulta costoso repetirlo en cada nuevo modelo fuerte, ya que el modelo objetivo debe generar muchas trayectorias durante el entrenamiento. A medida que los modelos escalan, el propio post-entrenamiento se convierte en un cuello de botella. Estudiamos una alternativa de débil a fuerte: ejecutar RL en un modelo más pequeño, donde las trayectorias son más baratas, y luego reutilizar lo que ese proceso de RL aprendió para mejorar un modelo objetivo más fuerte. Destilar directamente al maestro débil post-RL no es suficiente, porque la política final del maestro mezcla ganancias útiles del RL con las limitaciones del modelo más pequeño. Proponemos Destilación Directa en Política (Direct-OPD), que transfiere en su lugar el cambio de política inducido por el RL del maestro. Direct-OPD compara al maestro post-RL con su propia referencia pre-RL y trata su razón logarítmica como una recompensa implícita densa para el estudiante. En términos sencillos, el par de puntos de control nos indica qué acciones el RL hizo más o menos probables en el modelo débil, y Direct-OPD aplica esa señal en los estados en política del propio estudiante más fuerte. Esto reutiliza directamente la señal de supervisión del RL del modelo débil sin ejecutar RL con recompensa dispersa en el modelo objetivo. Empíricamente, Direct-OPD aprovecha consistentemente a maestros más débiles para mejorar modelos objetivo más fuertes; notablemente, eleva a Qwen3-1.7B del 48.3% al 58.3% en AIME 2024 en solo 4 horas en 8 GPUs A100. Supera al RL directo con igualación de pasos y permite la composición secuencial de múltiples cambios de política. Nuestros resultados muestran que los resultados del RL pueden reutilizarse entre escalas de modelo como señales de recompensa implícitas, no solo como modelos finales para imitar.
English
Reinforcement learning with verifiable rewards (RLVR) is a powerful recipe for improving language-model reasoning, but it is expensive to repeat on every new strong model because the target model must generate many rollouts during training. As models scale, post-training itself becomes a bottleneck. We study a weak-to-strong alternative: run RL on a smaller model where rollouts are cheaper, then reuse what that RL run learned to improve a stronger target model. Directly distilling the post-RL weak teacher is not enough, because the teacher's final policy mixes useful RL gains with the limitations of the smaller model. We propose Direct On-Policy Distillation (Direct-OPD), which transfers the teacher's RL-induced policy shift instead. Direct-OPD compares the post-RL teacher with its own pre-RL reference and treats their log-ratio as a dense implicit reward for the student. In plain terms, the checkpoint pair tells us which actions RL made the weak model more or less likely to take, and Direct-OPD applies that signal on the stronger student's own on-policy states. This directly reuses the weak model's RL supervision signal without running sparse-reward RL on the target model. Empirically, Direct-OPD consistently leverages weaker teachers to improve stronger target models; notably, it boosts Qwen3-1.7B from 48.3% to 58.3% on AIME 2024 in just 4 hours on 8 A100 GPUs. It outperforms step-matched direct RL and enables the sequential composition of multiple policy shifts. Our results show that RL outcomes can be reused across model scales as implicit reward signals, not merely as final models to imitate.
PDF932July 15, 2026