ChatPaper.aiChatPaper

SlimQwen: Het verkennen van pruning en distillatie in de pre-training van grote MoE-modellen

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

May 9, 2026
Auteurs: Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu
cs.AI

Samenvatting

Gestructureerd snoeien en kennisdistillatie (KD) zijn typische technieken voor het comprimeren van grote taalmodellen, maar het blijft onduidelijk hoe ze moeten worden toegepast op de schaal van voortraining, met name bij recente mengsel-van-experts (MoE)-modellen. In dit werk bestuderen we systematisch MoE-compressie in grootschalige voortraining, met focus op drie kernvragen: of snoeien een betere initiatie biedt dan trainen vanaf nul, hoe expertcompressiekeuzes het uiteindelijke model beïnvloeden na voortgezette training, en welke trainingsstrategie het meest effectief is. We komen tot de volgende bevindingen: Ten eerste, over compressie in diepte, breedte en experts heen, presteert het snoeien van een voorgetraind MoE consequent beter dan het trainen van de doelarchitectuur vanaf nul onder hetzelfde trainingsbudget. Ten tweede convergeren verschillende eenmalige expertcompressiemethoden naar vergelijkbare eindprestaties na grootschalige continue voortraining. Gemotiveerd door dit inzicht introduceren we een eenvoudige partiële-preservatie-expertfusiestrategie die de downstreamprestaties over de meeste benchmarks verbetert. Ten derde presteert het combineren van KD met het taalmodelleringsverlies beter dan KD alleen, vooral bij kennisintensieve taken. Verder stellen we multi-tokenvoorspellingsdistillatie (MTP-distillatie) voor, die consistente winst oplevert. Tot slot, gegeven hetzelfde aantal trainingstokens, presteren progressieve snoeischema's beter dan eenmalige compressie, wat erop wijst dat geleidelijke architectuurovergangen leiden tot betere optimalisatietrajecten. Alles overziend comprimeren we Qwen3-Next-80A3B tot een 23A2B-model dat concurrerende prestaties behoudt. Deze resultaten bieden praktische richtlijnen voor efficiënte MoE-compressie op schaal.
English
Structured pruning and knowledge distillation (KD) are typical techniques for compressing large language models, but it remains unclear how they should be applied at pretraining scale, especially to recent mixture-of-experts (MoE) models. In this work, we systematically study MoE compression in large-scale pretraining, focusing on three key questions: whether pruning provides a better initialization than training from scratch, how expert compression choices affect the final model after continued training, and which training strategy is most effective. We have the following findings: First, across depth, width, and expert compression, pruning a pretrained MoE consistently outperforms training the target architecture from scratch under the same training budget. Second, different one-shot expert compression methods converge to similar final performance after large-scale continual pretraining. Motivated by this, we introduce a simple partial-preservation expert merging strategy that improves downstream performance across most benchmarks. Third, combining KD with the language modeling loss outperforms KD alone, particularly on knowledge-intensive tasks. We further propose multi-token prediction (MTP) distillation, which yields consistent gains. Finally, given the same training tokens, progressive pruning schedules outperform one-shot compression, suggesting that gradual architecture transitions lead to better optimization trajectories. Putting it all together, we compress Qwen3-Next-80A3B to a 23A2B model that retains competitive performance. These results offer practical guidance for efficient MoE compression at scale.