ChatPaper.aiChatPaper

ShortOPD : Récupération de LLMs élagués par distillation on-policy du court au long

ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation

July 14, 2026
Auteurs: Qingyu Zhang, Qianhao Yuan, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun, Xiang Li, Ming Xu, Jiarui Li, Xiuyin Zhao
cs.AI

Résumé

L'élagage structuré est une méthode compatible avec le matériel pour compresser les LLM, mais il est principalement validé sur des tâches de reconnaissance à choix multiples, alors que les mêmes points de contrôle compressés peuvent s'effondrer sur la génération libre que le déploiement réel exige. Deux observations expliquent cet écart. Premièrement, le pass@1 glouton disparaît presque après compression, alors que le pass@k se rétablit considérablement sous un échantillonnage répété : les générations utiles sont rétrogradées, non effacées. Deuxièmement, le régime de récupération échoue principalement par répétition de suffixes. La récupération devrait donc s'entraîner sur les propres états en politique du modèle compressé, avec une supervision dense au niveau des tokens, ce que la Distillation en Politique (OPD) fournit en réutilisant le modèle pré-compression comme enseignant figé. Cependant, les longs déploiements en politique dépensent le budget de récupération précoce sur des suffixes répétitifs à faible information, retardant la descente de la perte. Pour atténuer ce gaspillage, nous proposons \shortopd, un calendrier OPD de court à long qui détecte les suffixes répétitifs confirmés par l'enseignant, traite le préfixe survivant comme la longueur effective de chaque déploiement, et alloue les budgets de déploiement futurs aux longueurs effectives que la politique peut actuellement utiliser. En mathématiques, en code et en génération ouverte, \shortopd élève le score du modèle compressé à environ 9 fois sa valeur non récupérée et 1,6 à 4,4 fois les recettes de récupération standard (SFT sans KD, KD, et SeqKD), et il égale un horizon de déploiement fixe de 8192 tokens à moins de deux points près en utilisant un quart du temps d'entraînement (8,5 contre 35,9 heures) et 71 % de tokens de déploiement en moins. Nous espérons que cette recette aidera à faire passer l'élagage structuré au-delà des gains marginaux sur la perplexité et les benchmarks à choix multiples, un pas de plus vers une qualité de génération prête au déploiement.
English
Structured pruning is a hardware-friendly way to compress LLMs, but it is mostly validated on multiple-choice recognition tasks, while the same compressed checkpoints can collapse on the free-form generation that deployment actually requires. Two observations trace this gap. First, greedy pass@1 nearly vanishes after compression, yet pass@k recovers substantially under repeated sampling: useful generations are demoted, not erased. Second, the recoverable regime fails mainly through suffix repetition. Recovery should therefore train on the compressed model's own on-policy states with dense token-level supervision, which On-Policy Distillation (OPD) provides by reusing the pre-compression model as a frozen teacher. However, long on-policy rollouts spend early recovery budget on low-information repetitive suffixes, delaying loss descent. To mitigate this waste, we propose \shortopd, a short-to-long OPD schedule that detects teacher-confirmed repetitive suffixes, treats the surviving prefix as each rollout's effective length, and allocates future rollout budgets to the effective lengths the policy can currently use. Across math, code, and open-ended generation, \shortopd\ raises the compressed model's score to about 9times its unrecovered value and 1.6--4.4times standard recovery recipes (SFT w/o KD, KD, and SeqKD), and it matches a fixed 8192-token rollout horizon within two points using a quarter of the training time (8.5 vs.\ 35.9 hours) and 71% fewer rollout tokens. We hope this recipe helps move structured pruning beyond marginal gains on perplexity and multiple-choice benchmarks, a step closer to deployment-ready generation quality.