SlimQwen: Explorando a Poda e a Destilação no Pré-treinamento de Grandes Modelos MoE
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
May 9, 2026
Autores: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu
cs.AI
Resumo
Poda estruturada e destilação de conhecimento (KD) são técnicas típicas para comprimir grandes modelos de linguagem, mas ainda não está claro como devem ser aplicadas em escala de pré-treinamento, especialmente em modelos recentes de mistura de especialistas (MoE). Neste trabalho, estudamos sistematicamente a compressão de MoE em pré-treinamento em larga escala, focando em três questões-chave: se a poda proporciona uma inicialização melhor do que treinar do zero, como as escolhas de compressão de especialistas afetam o modelo final após treinamento contínuo e qual estratégia de treinamento é mais eficaz. Temos as seguintes descobertas: Primeiro, em termos de profundidade, largura e compressão de especialistas, podar um MoE pré-treinado supera consistentemente o treinamento da arquitetura alvo do zero sob o mesmo orçamento de treinamento. Segundo, diferentes métodos de compressão única de especialistas convergem para um desempenho final semelhante após pré-treinamento contínuo em larga escala. Motivados por isso, introduzimos uma estratégia simples de mesclagem de especialistas com preservação parcial que melhora o desempenho downstream na maioria dos benchmarks. Terceiro, combinar KD com a perda de modelagem de linguagem supera o uso apenas de KD, particularmente em tarefas intensivas em conhecimento. Propomos ainda a destilação por predição de múltiplos tokens (MTP), que gera ganhos consistentes. Finalmente, para o mesmo número de tokens de treinamento, cronogramas de poda progressiva superam a compressão única, sugerindo que transições graduais de arquitetura levam a trajetórias de otimização melhores. Unindo tudo isso, comprimimos o Qwen3-Next-80A3B para um modelo 23A2B que mantém desempenho competitivo. Esses resultados oferecem orientações práticas para compressão eficiente de MoE em escala.
English
Structured pruning and knowledge distillation (KD) are typical techniques for compressing large language models, but it remains unclear how they should be applied at pretraining scale, especially to recent mixture-of-experts (MoE) models. In this work, we systematically study MoE compression in large-scale pretraining, focusing on three key questions: whether pruning provides a better initialization than training from scratch, how expert compression choices affect the final model after continued training, and which training strategy is most effective. We have the following findings: First, across depth, width, and expert compression, pruning a pretrained MoE consistently outperforms training the target architecture from scratch under the same training budget. Second, different one-shot expert compression methods converge to similar final performance after large-scale continual pretraining. Motivated by this, we introduce a simple partial-preservation expert merging strategy that improves downstream performance across most benchmarks. Third, combining KD with the language modeling loss outperforms KD alone, particularly on knowledge-intensive tasks. We further propose multi-token prediction (MTP) distillation, which yields consistent gains. Finally, given the same training tokens, progressive pruning schedules outperform one-shot compression, suggesting that gradual architecture transitions lead to better optimization trajectories. Putting it all together, we compress Qwen3-Next-80A3B to a 23A2B model that retains competitive performance. These results offer practical guidance for efficient MoE compression at scale.