SlimQwen : Exploration de l'élagage et de la distillation dans le pré-entraînement de grands modèles MoE
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
May 9, 2026
Auteurs: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu
cs.AI
Résumé
L'élagage structuré et la distillation des connaissances (KD) sont des techniques typiques de compression des grands modèles de langage, mais leur application à l'échelle du pré-entraînement reste mal comprise, en particulier pour les modèles récents à mélange d'experts (MoE). Dans ce travail, nous étudions systématiquement la compression des MoE lors du pré-entraînement à grande échelle, en nous concentrant sur trois questions clés : l'élagage offre-t-il une meilleure initialisation que l'entraînement à partir de zéro ? Comment les choix de compression des experts affectent-ils le modèle final après un entraînement continu ? Et quelle stratégie d'entraînement est la plus efficace ? Nous obtenons les résultats suivants : Premièrement, que ce soit en profondeur, en largeur ou en compression d'experts, élaguer un MoE pré-entraîné surpasse systématiquement l'entraînement à partir de zéro de l'architecture cible, à budget d'entraînement égal. Deuxièmement, différentes méthodes de compression ponctuelle des experts convergent vers des performances finales similaires après un pré-entraînement continu à grande échelle. Motivés par ce constat, nous introduisons une stratégie simple de fusion d'experts avec préservation partielle qui améliore les performances en aval sur la plupart des références. Troisièmement, la combinaison de la KD avec la perte de modélisation du langage surpasse la KD seule, en particulier sur les tâches intensives en connaissances. Nous proposons en outre la distillation par prédiction multi-tokens (MTP), qui apporte des gains constants. Enfin, à nombre de tokens d'entraînement égal, les programmes d'élagage progressifs surpassent la compression ponctuelle, ce qui suggère que des transitions architecturales graduelles conduisent à de meilleures trajectoires d'optimisation. En synthèse, nous compressons Qwen3-Next-80A3B en un modèle 23A2B qui conserve des performances compétitives. Ces résultats offrent des conseils pratiques pour une compression efficace des MoE à grande échelle.
English
Structured pruning and knowledge distillation (KD) are typical techniques for compressing large language models, but it remains unclear how they should be applied at pretraining scale, especially to recent mixture-of-experts (MoE) models. In this work, we systematically study MoE compression in large-scale pretraining, focusing on three key questions: whether pruning provides a better initialization than training from scratch, how expert compression choices affect the final model after continued training, and which training strategy is most effective. We have the following findings: First, across depth, width, and expert compression, pruning a pretrained MoE consistently outperforms training the target architecture from scratch under the same training budget. Second, different one-shot expert compression methods converge to similar final performance after large-scale continual pretraining. Motivated by this, we introduce a simple partial-preservation expert merging strategy that improves downstream performance across most benchmarks. Third, combining KD with the language modeling loss outperforms KD alone, particularly on knowledge-intensive tasks. We further propose multi-token prediction (MTP) distillation, which yields consistent gains. Finally, given the same training tokens, progressive pruning schedules outperform one-shot compression, suggesting that gradual architecture transitions lead to better optimization trajectories. Putting it all together, we compress Qwen3-Next-80A3B to a 23A2B model that retains competitive performance. These results offer practical guidance for efficient MoE compression at scale.