ChatPaper.aiChatPaper

ShortOPD: Wiederherstellung beschnittener LLMs durch Kurz-zu-Lang-On-Policy-Destillation

ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation

July 14, 2026
Autoren: Qingyu Zhang, Qianhao Yuan, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun, Xiang Li, Ming Xu, Jiarui Li, Xiuyin Zhao
cs.AI

Zusammenfassung

Strukturiertes Pruning ist eine hardwarefreundliche Methode zur Kompression großer Sprachmodelle (LLMs), wird aber meist nur an Multiple-Choice-Erkennungsaufgaben validiert, während dieselben komprimierten Prüfpunkte bei der für den tatsächlichen Einsatz erforderlichen freien Textgenerierung versagen können. Zwei Beobachtungen erklären diese Lücke. Erstens verschwindet der greedy Pass@1 nach der Kompression nahezu vollständig, während Pass@k durch wiederholtes Sampling deutlich ansteigt: Nutzbare Generierungen werden herabgestuft, nicht gelöscht. Zweitens scheitert der wiederherstellbare Bereich hauptsächlich an Suffixwiederholungen. Eine Erholung sollte daher an den eigenen On-Policy-Zuständen des komprimierten Modells mit dichter Token-Ebene-Überwachung trainieren, was die On-Policy-Destillation (OPD) bietet, indem sie das Modell vor der Kompression als eingefrorenen Lehrer wiederverwendet. Lange On-Policy-Rollouts verbrauchen jedoch frühes Erholungsbudget für informationsarme, repetitive Suffixe und verzögern den Verlustabfall. Um diese Verschwendung zu verringern, schlagen wir \shortopd\ vor, einen Short-to-Long-OPD-Ablauf, der lehrerbestätigte repetitive Suffixe erkennt, das verbleibende Präfix als effektive Länge jedes Rollouts behandelt und zukünftige Rollout-Budgets den effektiven Längen zuweist, die die Politik derzeit nutzen kann. In Mathematik, Code und offener Generierung erhöht \shortopd\ die Punktzahl des komprimierten Modells auf etwa das 9-fache seines unerholten Werts und das 1,6- bis 4,4-fache standardmäßiger Erholungsrezepte (SFT ohne KD, KD und SeqKD) und erreicht mit einem Viertel der Trainingszeit (8,5 gegenüber 35,9 Stunden) und 71 % weniger Rollout-Tokens einen festen 8192-Token-Rollout-Horizont innerhalb von zwei Punkten. Wir hoffen, dass dieses Rezept dazu beiträgt, strukturiertes Pruning über marginale Verbesserungen bei Perplexität und Multiple-Choice-Benchmarks hinauszuführen – einen Schritt näher an die einsatzbereite Generierungsqualität.
English
Structured pruning is a hardware-friendly way to compress LLMs, but it is mostly validated on multiple-choice recognition tasks, while the same compressed checkpoints can collapse on the free-form generation that deployment actually requires. Two observations trace this gap. First, greedy pass@1 nearly vanishes after compression, yet pass@k recovers substantially under repeated sampling: useful generations are demoted, not erased. Second, the recoverable regime fails mainly through suffix repetition. Recovery should therefore train on the compressed model's own on-policy states with dense token-level supervision, which On-Policy Distillation (OPD) provides by reusing the pre-compression model as a frozen teacher. However, long on-policy rollouts spend early recovery budget on low-information repetitive suffixes, delaying loss descent. To mitigate this waste, we propose \shortopd, a short-to-long OPD schedule that detects teacher-confirmed repetitive suffixes, treats the surviving prefix as each rollout's effective length, and allocates future rollout budgets to the effective lengths the policy can currently use. Across math, code, and open-ended generation, \shortopd\ raises the compressed model's score to about 9times its unrecovered value and 1.6--4.4times standard recovery recipes (SFT w/o KD, KD, and SeqKD), and it matches a fixed 8192-token rollout horizon within two points using a quarter of the training time (8.5 vs.\ 35.9 hours) and 71% fewer rollout tokens. We hope this recipe helps move structured pruning beyond marginal gains on perplexity and multiple-choice benchmarks, a step closer to deployment-ready generation quality.