Демистификация дистилляции на политике: роли, патологии и регуляции
Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
July 15, 2026
Авторы: Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong
cs.AI
Аннотация
Дистилляция на политике (OPD) стала ключевой парадигмой в пост-обучении больших языковых моделей (БЯМ), однако её тренировочная динамика остаётся плохо изученной. Мы представляем систематическое исследование, посвящённое роли, патологиям и регуляции OPD. Сначала мы уточняем роль OPD как катализатора исследования: она направляет студента к корректным путям рассуждения посредством плотного токен-уровневого руководства, не расширяя при этом потолка возможностей. Мы подтверждаем это, демонстрируя, что разнообразие промптов важнее числа выборок на задачу, и, критически, что эффективность OPD полностью зависит от качества её направляющего сигнала. Эта зависимость выявляет две патологии, которые сбивают исследование с курса. Несоответствие студент-учитель возникает, когда большой разрыв в распределениях между учителем и студентом приводит к тому, что направляющий сигнал расходится с корректностью задачи, направляя исследование в контрпродуктивные направления. Эксплуатация длины возникает, когда агрегированная токен-уровневая цель создаёт зависящие от длины сокращения пути, позволяя студенту манипулировать ландшафтом вознаграждений через усечение ответов или избыточное дополнение, исследуя вырожденные моды длины вместо стратегий рассуждения. Для устранения этих патологий мы исследуем лёгкие сигнальные регуляции: ограничение преимущества и логарифмическое сжатие, обеспечивая, чтобы исследование направлялось достоверными сигналами. Эксперименты на семи бенчмарках показывают, что эти регуляции уменьшают эксплуатацию длины и обеспечивают эффективную дистилляцию, стабильно превосходя варианты OPD и базовые линии RLVR, тем самым подтверждая, что успешное исследование в OPD определяется качеством хорошо регулируемого сигнала, а не просто масштабом учителя.
English
On-policy distillation (OPD) has become a key paradigm in LLM post-training, yet its training dynamics remain poorly understood. We present a systematic study examining the role, pathologies, and regulations of OPD. We first clarify the role of OPD as an exploration catalyst: it steers the student toward correct reasoning paths via dense token-level guidance, without expanding capability ceiling. We confirm this by showing that prompt diversity matters more than per-problem sampling numbers, and critically, that the effectiveness of OPD hinges entirely on the quality of its guiding signal. This dependency exposes two pathologies that derail exploration. The Student-Teacher Mismatch occurs when a large teacher-student distributional gap causes the guiding signal to misalign with task correctness, steering exploration in counterproductive directions. Length Exploitation arises when the aggregated token-level objective creates length-dependent shortcuts, allowing the student to game the reward landscape through response truncation or redundant padding, exploring degenerate length modes rather than reasoning strategies. To tame these pathologies, we investigate lightweight signal regulations: advantage clipping and log-scale compression, ensuring exploration is guided by faithful signals. Experiments across seven benchmarks demonstrate that these regulations alleviate length exploitation and enable effective distillation, stably surpassing OPD variants and RLVR baselines, thereby confirming that well-regulated signal quality, rather than mere teacher scale, governs successful exploration in OPD.