ChatPaper.aiChatPaper

ShortOPD: Recuperação de LLMs Podados com Destilação On-Policy de Curto para Longo

ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation

July 14, 2026
Autores: Qingyu Zhang, Qianhao Yuan, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun, Xiang Li, Ming Xu, Jiarui Li, Xiuyin Zhao
cs.AI

Resumo

A poda estruturada é uma forma eficiente de comprimir modelos de linguagem de grande escala (LLMs) do ponto de vista de hardware, mas é majoritariamente validada em tarefas de reconhecimento de múltipla escolha, enquanto os mesmos checkpoints comprimidos podem colapsar na geração de formato livre que a implantação realmente exige. Duas observações explicam essa lacuna. Primeiro, o greedy pass@1 quase desaparece após a compressão, mas o pass@k se recupera substancialmente com amostragem repetida: as gerações úteis são rebaixadas, não apagadas. Segundo, o regime recuperável falha principalmente por meio da repetição de sufixos. A recuperação deve, portanto, treinar nos próprios estados on-policy do modelo comprimido com supervisão densa em nível de token, o que a Destilação On-Policy (OPD) proporciona ao reutilizar o modelo pré-compressão como um professor congelado. No entanto, rollouts on-policy longos gastam o orçamento inicial de recuperação em sufixos repetitivos de baixa informação, atrasando a redução da perda. Para mitigar esse desperdício, propomos \shortopd, um cronograma de OPD curto-para-longo que detecta sufixos repetitivos confirmados pelo professor, trata o prefixo sobrevivente como o comprimento efetivo de cada rollout e aloca orçamentos futuros de rollout aos comprimentos efetivos que a política pode utilizar atualmente. Em tarefas de matemática, código e geração aberta, \shortopd eleva a pontuação do modelo comprimido para cerca de 9 vezes seu valor não recuperado e 1,6 a 4,4 vezes as receitas de recuperação padrão (SFT sem KD, KD e SeqKD), e iguala um horizonte fixo de rollout de 8192 tokens dentro de dois pontos usando um quarto do tempo de treinamento (8,5 vs. 35,9 horas) e 71% menos tokens de rollout. Esperamos que essa receita ajude a mover a poda estruturada além de ganhos marginais em perplexidade e benchmarks de múltipla escolha, um passo mais próximo da qualidade de geração pronta para implantação.
English
Structured pruning is a hardware-friendly way to compress LLMs, but it is mostly validated on multiple-choice recognition tasks, while the same compressed checkpoints can collapse on the free-form generation that deployment actually requires. Two observations trace this gap. First, greedy pass@1 nearly vanishes after compression, yet pass@k recovers substantially under repeated sampling: useful generations are demoted, not erased. Second, the recoverable regime fails mainly through suffix repetition. Recovery should therefore train on the compressed model's own on-policy states with dense token-level supervision, which On-Policy Distillation (OPD) provides by reusing the pre-compression model as a frozen teacher. However, long on-policy rollouts spend early recovery budget on low-information repetitive suffixes, delaying loss descent. To mitigate this waste, we propose \shortopd, a short-to-long OPD schedule that detects teacher-confirmed repetitive suffixes, treats the surviving prefix as each rollout's effective length, and allocates future rollout budgets to the effective lengths the policy can currently use. Across math, code, and open-ended generation, \shortopd\ raises the compressed model's score to about 9times its unrecovered value and 1.6--4.4times standard recovery recipes (SFT w/o KD, KD, and SeqKD), and it matches a fixed 8192-token rollout horizon within two points using a quarter of the training time (8.5 vs.\ 35.9 hours) and 71% fewer rollout tokens. We hope this recipe helps move structured pruning beyond marginal gains on perplexity and multiple-choice benchmarks, a step closer to deployment-ready generation quality.