ChatPaper.aiChatPaper

Desmitificación de la Destilación On-Policy: Roles, Patologías y Regulaciones

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

July 15, 2026
Autores: Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong
cs.AI

Resumen

La destilación en política (on-policy distillation, OPD) se ha convertido en un paradigma clave en el post-entrenamiento de modelos de lenguaje grandes (LLM), aunque sus dinámicas de entrenamiento siguen siendo poco comprendidas. Presentamos un estudio sistemático que examina el rol, las patologías y las regulaciones de la OPD. Primero aclaramos el papel de la OPD como catalizador de exploración: orienta al estudiante hacia caminos de razonamiento correctos mediante una guía densa a nivel de token, sin expandir el techo de capacidad. Confirmamos esto mostrando que la diversidad de indicaciones es más importante que la cantidad de muestreos por problema y, de manera crítica, que la efectividad de la OPD depende completamente de la calidad de su señal guía. Esta dependencia expone dos patologías que desvían la exploración. El desajuste estudiante-maestro ocurre cuando una brecha distribucional grande entre maestro y estudiante provoca que la señal guía se desalinee con la corrección de la tarea, dirigiendo la exploración en direcciones contraproducentes. La explotación de la longitud surge cuando el objetivo agregado a nivel de token crea atajos dependientes de la longitud, permitiendo que el estudiante manipule el panorama de recompensas mediante truncamiento de respuestas o relleno redundante, explorando modos degenerados de longitud en lugar de estrategias de razonamiento. Para domar estas patologías, investigamos regulaciones ligeras de la señal: recorte de ventaja y compresión en escala logarítmica, asegurando que la exploración sea guiada por señales fiables. Experimentos en siete puntos de referencia demuestran que estas regulaciones alivian la explotación de la longitud y permiten una destilación efectiva, superando de manera estable variantes de OPD y líneas base de RLVR, confirmando así que la calidad de la señal bien regulada, y no meramente la escala del maestro, gobierna la exploración exitosa en OPD.
English
On-policy distillation (OPD) has become a key paradigm in LLM post-training, yet its training dynamics remain poorly understood. We present a systematic study examining the role, pathologies, and regulations of OPD. We first clarify the role of OPD as an exploration catalyst: it steers the student toward correct reasoning paths via dense token-level guidance, without expanding capability ceiling. We confirm this by showing that prompt diversity matters more than per-problem sampling numbers, and critically, that the effectiveness of OPD hinges entirely on the quality of its guiding signal. This dependency exposes two pathologies that derail exploration. The Student-Teacher Mismatch occurs when a large teacher-student distributional gap causes the guiding signal to misalign with task correctness, steering exploration in counterproductive directions. Length Exploitation arises when the aggregated token-level objective creates length-dependent shortcuts, allowing the student to game the reward landscape through response truncation or redundant padding, exploring degenerate length modes rather than reasoning strategies. To tame these pathologies, we investigate lightweight signal regulations: advantage clipping and log-scale compression, ensuring exploration is guided by faithful signals. Experiments across seven benchmarks demonstrate that these regulations alleviate length exploitation and enable effective distillation, stably surpassing OPD variants and RLVR baselines, thereby confirming that well-regulated signal quality, rather than mere teacher scale, governs successful exploration in OPD.