ShortOPD: Herstel van Geprune LLM's door Kort-naar-Lang On-Policy Distillatie
ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation
July 14, 2026
Auteurs: Qingyu Zhang, Qianhao Yuan, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun, Xiang Li, Ming Xu, Jiarui Li, Xiuyin Zhao
cs.AI
Samenvatting
Gestructureerd snoeien is een hardwarevriendelijke manier om grote taalmodellen (LLM's) te comprimeren, maar het wordt voornamelijk gevalideerd op meerkeuzetaken voor herkenning, terwijl dezelfde gecomprimeerde controlepuntmodellen kunnen instorten bij de vrije generatie die implementatie daadwerkelijk vereist. Twee observaties verklaren deze kloof. Ten eerste verdwijnt greedy pass@1 vrijwel volledig na compressie, maar herstelt pass@k aanzienlijk onder herhaalde steekproefname: nuttige generaties worden gedegradeerd, niet gewist. Ten tweede faalt het herstelbare regime voornamelijk door herhaling van achtervoegsels. Herstel zou daarom moeten trainen op de eigen on-policy toestanden van het gecomprimeerde model met dichte supervisie op tokenniveau, wat On-Policy Distillation (OPD) biedt door het model vóór compressie als een bevroren leraar te hergebruiken. Lange on-policy rollouts besteden echter het vroege herstelbudget aan informatiearme repetitieve achtervoegsels, waardoor de verliesafname wordt vertraagd. Om deze verspilling te beperken stellen we \shortopd voor, een kort-naar-lang OPD-schema dat door de leraar bevestigde repetitieve achtervoegsels detecteert, het overlevende voorvoegsel beschouwt als de effectieve lengte van elke rollout, en toekomstige rolloutbudgetten toewijst aan de effectieve lengtes die het beleid momenteel kan gebruiken. Voor wiskunde, code en open-eindgeneratie verhoogt \shortopd de score van het gecomprimeerde model tot ongeveer 9× de niet-herstelde waarde en 1,6–4,4× de standaard herstelrecepten (SFT zonder KD, KD en SeqKD), en het benadert een vaste rollout horizon van 8192 tokens binnen twee punten met een kwart van de trainingstijd (8,5 vs. 35,9 uur) en 71% minder rollouttokens. We hopen dat dit recept helpt om gestructureerd snoeien verder te brengen dan marginale winst op perplexiteit en meerkeuzebenchmarks, een stap dichter bij implementatieklare generatiekwaliteit.
English
Structured pruning is a hardware-friendly way to compress LLMs, but it is mostly validated on multiple-choice recognition tasks, while the same compressed checkpoints can collapse on the free-form generation that deployment actually requires. Two observations trace this gap. First, greedy pass@1 nearly vanishes after compression, yet pass@k recovers substantially under repeated sampling: useful generations are demoted, not erased. Second, the recoverable regime fails mainly through suffix repetition. Recovery should therefore train on the compressed model's own on-policy states with dense token-level supervision, which On-Policy Distillation (OPD) provides by reusing the pre-compression model as a frozen teacher. However, long on-policy rollouts spend early recovery budget on low-information repetitive suffixes, delaying loss descent. To mitigate this waste, we propose \shortopd, a short-to-long OPD schedule that detects teacher-confirmed repetitive suffixes, treats the surviving prefix as each rollout's effective length, and allocates future rollout budgets to the effective lengths the policy can currently use. Across math, code, and open-ended generation, \shortopd\ raises the compressed model's score to about 9times its unrecovered value and 1.6--4.4times standard recovery recipes (SFT w/o KD, KD, and SeqKD), and it matches a fixed 8192-token rollout horizon within two points using a quarter of the training time (8.5 vs.\ 35.9 hours) and 71% fewer rollout tokens. We hope this recipe helps move structured pruning beyond marginal gains on perplexity and multiple-choice benchmarks, a step closer to deployment-ready generation quality.