ShortOPD: Recuperación de LLMs podados mediante destilación on-policy de corto a largo
ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation
July 14, 2026
Autores: Qingyu Zhang, Qianhao Yuan, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun, Xiang Li, Ming Xu, Jiarui Li, Xiuyin Zhao
cs.AI
Resumen
El podado estructurado es una forma eficiente en hardware para comprimir modelos de lenguaje de gran escala (LLMs), pero se valida principalmente en tareas de reconocimiento de opción múltiple, mientras que los mismos puntos de control comprimidos pueden colapsar en la generación de formato libre que el despliegue real requiere. Dos observaciones explican esta brecha. Primero, el greedy pass@1 casi desaparece tras la compresión, pero el pass@k se recupera sustancialmente bajo muestreo repetido: las generaciones útiles son degradadas, no eliminadas. Segundo, el régimen recuperable falla principalmente por la repetición de sufijos. Por lo tanto, la recuperación debería entrenarse sobre los propios estados on-policy del modelo comprimido con supervisión densa a nivel de token, lo que proporciona la Destilación On-Policy (OPD) al reutilizar el modelo previo a la compresión como un maestro congelado. Sin embargo, los rollouts on-policy largos gastan el presupuesto temprano de recuperación en sufijos repetitivos de baja información, retrasando la disminución de la pérdida. Para mitigar este desperdicio, proponemos \shortopd, un esquema OPD de corto a largo que detecta sufijos repetitivos confirmados por el maestro, trata el prefijo superviviente como la longitud efectiva de cada rollout y asigna presupuestos futuros de rollout a las longitudes efectivas que la política puede utilizar actualmente. En tareas de matemáticas, código y generación abierta, \shortopd\ eleva la puntuación del modelo comprimido a aproximadamente 9 veces su valor no recuperado y entre 1.6 y 4.4 veces las recetas de recuperación estándar (SFT sin KD, KD y SeqKD), e iguala un horizonte de rollout fijo de 8192 tokens dentro de dos puntos usando un cuarto del tiempo de entrenamiento (8.5 frente a 35.9 horas) y un 71% menos de tokens de rollout. Esperamos que esta receta ayude a llevar el podado estructurado más allá de las mejoras marginales en perplejidad y benchmarks de opción múltiple, un paso más cerca de la calidad de generación apta para despliegue.
English
Structured pruning is a hardware-friendly way to compress LLMs, but it is mostly validated on multiple-choice recognition tasks, while the same compressed checkpoints can collapse on the free-form generation that deployment actually requires. Two observations trace this gap. First, greedy pass@1 nearly vanishes after compression, yet pass@k recovers substantially under repeated sampling: useful generations are demoted, not erased. Second, the recoverable regime fails mainly through suffix repetition. Recovery should therefore train on the compressed model's own on-policy states with dense token-level supervision, which On-Policy Distillation (OPD) provides by reusing the pre-compression model as a frozen teacher. However, long on-policy rollouts spend early recovery budget on low-information repetitive suffixes, delaying loss descent. To mitigate this waste, we propose \shortopd, a short-to-long OPD schedule that detects teacher-confirmed repetitive suffixes, treats the surviving prefix as each rollout's effective length, and allocates future rollout budgets to the effective lengths the policy can currently use. Across math, code, and open-ended generation, \shortopd\ raises the compressed model's score to about 9times its unrecovered value and 1.6--4.4times standard recovery recipes (SFT w/o KD, KD, and SeqKD), and it matches a fixed 8192-token rollout horizon within two points using a quarter of the training time (8.5 vs.\ 35.9 hours) and 71% fewer rollout tokens. We hope this recipe helps move structured pruning beyond marginal gains on perplexity and multiple-choice benchmarks, a step closer to deployment-ready generation quality.