Démystifier la distillation sur politique : rôles, pathologies et régulations
Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
July 15, 2026
Auteurs: Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong
cs.AI
Résumé
La distillation sur politique (OPD) est devenue un paradigme clé dans le post-entraînement des LLM, mais ses dynamiques d'entraînement restent mal comprises. Nous présentons une étude systématique examinant le rôle, les pathologies et les régulations de l'OPD. Nous clarifions d'abord le rôle de l'OPD comme catalyseur d'exploration : elle oriente l'étudiant vers des chemins de raisonnement corrects via un guidage dense au niveau des tokens, sans élargir le plafond de capacité. Nous confirmons cela en montrant que la diversité des prompts importe plus que le nombre d'échantillons par problème, et surtout que l'efficacité de l'OPD repose entièrement sur la qualité de son signal de guidage. Cette dépendance expose deux pathologies qui font dérailler l'exploration. Le décalage étudiant-enseignant survient lorsqu'un grand écart de distribution entre l'enseignant et l'étudiant fait que le signal de guidage s'aligne mal avec la correction de la tâche, orientant l'exploration dans des directions contre-productives. L'exploitation de la longueur apparaît lorsque l'objectif agrégé au niveau des tokens crée des raccourcis dépendants de la longueur, permettant à l'étudiant de jouer avec le paysage des récompenses par troncature ou ajout redondant de tokens, explorant des modes de longueur dégénérés plutôt que des stratégies de raisonnement. Pour maîtriser ces pathologies, nous étudions des régulations légères du signal : l'écrêtage de l'avantage et la compression logarithmique, assurant que l'exploration est guidée par des signaux fidèles. Des expériences sur sept benchmarks montrent que ces régulations atténuent l'exploitation de la longueur et permettent une distillation efficace, surpassant de manière stable les variantes d'OPD et les références RLVR, confirmant ainsi que c'est la qualité du signal bien régulée, et non la simple échelle de l'enseignant, qui gouverne une exploration réussie dans l'OPD.
English
On-policy distillation (OPD) has become a key paradigm in LLM post-training, yet its training dynamics remain poorly understood. We present a systematic study examining the role, pathologies, and regulations of OPD. We first clarify the role of OPD as an exploration catalyst: it steers the student toward correct reasoning paths via dense token-level guidance, without expanding capability ceiling. We confirm this by showing that prompt diversity matters more than per-problem sampling numbers, and critically, that the effectiveness of OPD hinges entirely on the quality of its guiding signal. This dependency exposes two pathologies that derail exploration. The Student-Teacher Mismatch occurs when a large teacher-student distributional gap causes the guiding signal to misalign with task correctness, steering exploration in counterproductive directions. Length Exploitation arises when the aggregated token-level objective creates length-dependent shortcuts, allowing the student to game the reward landscape through response truncation or redundant padding, exploring degenerate length modes rather than reasoning strategies. To tame these pathologies, we investigate lightweight signal regulations: advantage clipping and log-scale compression, ensuring exploration is guided by faithful signals. Experiments across seven benchmarks demonstrate that these regulations alleviate length exploitation and enable effective distillation, stably surpassing OPD variants and RLVR baselines, thereby confirming that well-regulated signal quality, rather than mere teacher scale, governs successful exploration in OPD.