ChatPaper.aiChatPaper

ShortOPD: Восстановление прореженных LLM с помощью дистилляции по политике от короткой к длинной

ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation

July 14, 2026
Авторы: Qingyu Zhang, Qianhao Yuan, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun, Xiang Li, Ming Xu, Jiarui Li, Xiuyin Zhao
cs.AI

Аннотация

Структурное прореживание — это аппаратно-ориентированный способ сжатия больших языковых моделей (LLM), однако он в основном проверяется на задачах распознавания с выбором ответа, в то время как те же сжатые контрольные точки могут разрушаться при свободной генерации, которая фактически требуется для развертывания. Два наблюдения объясняют этот разрыв. Во-первых, жадный показатель pass@1 почти исчезает после сжатия, но pass@k значительно восстанавливается при повторной выборке: полезные генерации не уничтожаются, а переводятся в разряд менее вероятных. Во-вторых, восстанавливаемый режим терпит неудачу в основном из-за повторяющихся суффиксов. Поэтому для восстановления следует обучать на собственных состояниях сжатой модели, соответствующих её текущей политике (on-policy), с плотным контролем на уровне токенов, что обеспечивает дистилляция по текущей политике (On-Policy Distillation, OPD) путём повторного использования модели до сжатия в качестве замороженного учителя. Однако длинные развертки по текущей политике тратят начальный бюджет восстановления на малоинформативные повторяющиеся суффиксы, замедляя снижение функции потерь. Чтобы уменьшить эту трату, мы предлагаем \shortopd — коротко-длинный график OPD, который выявляет подтверждённые учителем повторяющиеся суффиксы, считает выживший префикс эффективной длиной каждой развертки и распределяет будущие бюджеты разверток на те эффективные длины, которые политика может использовать в данный момент. В задачах математики, кода и открытой генерации \shortopd\ повышает оценку сжатой модели примерно в 9 раз по сравнению с её невосстановленным значением и в 1,6–4,4 раза по сравнению со стандартными рецептами восстановления (SFT без KD, KD и SeqKD), а также достигает результата фиксированного горизонта развертки в 8192 токена в пределах двух пунктов, используя лишь четверть времени обучения (8,5 против 35,9 часов) и на 71% меньше токенов развертки. Мы надеемся, что этот рецепт поможет продвинуть структурное прореживание за пределы маргинальных улучшений перплексии и тестов с выбором ответа — на шаг ближе к качеству генерации, пригодному для развёртывания.
English
Structured pruning is a hardware-friendly way to compress LLMs, but it is mostly validated on multiple-choice recognition tasks, while the same compressed checkpoints can collapse on the free-form generation that deployment actually requires. Two observations trace this gap. First, greedy pass@1 nearly vanishes after compression, yet pass@k recovers substantially under repeated sampling: useful generations are demoted, not erased. Second, the recoverable regime fails mainly through suffix repetition. Recovery should therefore train on the compressed model's own on-policy states with dense token-level supervision, which On-Policy Distillation (OPD) provides by reusing the pre-compression model as a frozen teacher. However, long on-policy rollouts spend early recovery budget on low-information repetitive suffixes, delaying loss descent. To mitigate this waste, we propose \shortopd, a short-to-long OPD schedule that detects teacher-confirmed repetitive suffixes, treats the surviving prefix as each rollout's effective length, and allocates future rollout budgets to the effective lengths the policy can currently use. Across math, code, and open-ended generation, \shortopd\ raises the compressed model's score to about 9times its unrecovered value and 1.6--4.4times standard recovery recipes (SFT w/o KD, KD, and SeqKD), and it matches a fixed 8192-token rollout horizon within two points using a quarter of the training time (8.5 vs.\ 35.9 hours) and 71% fewer rollout tokens. We hope this recipe helps move structured pruning beyond marginal gains on perplexity and multiple-choice benchmarks, a step closer to deployment-ready generation quality.