DECO: Sparse Mixture-of-Experts met prestaties vergelijkbaar met dichte modellen op randapparaten
DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices
May 11, 2026
Auteurs: Chenyang Song, Weilin Zhao, Xu Han, Chaojun Xiao, Yingfa Chen, Zhiyuan Liu
cs.AI
Samenvatting
Hoewel Mixture-of-Experts (MoE) de modelcapaciteit opschaalt zonder de rekenkracht evenredig te verhogen, creëert de enorme totale parameteromvang aanzienlijke opslag- en geheugentoegangsknelpunten, die een efficiënte implementatie aan de eindzijde belemmeren waarbij tegelijkertijd hoge prestaties, lage rekenkosten en een kleine opslagoverhead vereist zijn. Om deze eigenschappen te bereiken presenteren we DECO, een schaarse MoE-architectuur die is ontworpen om de prestaties van dichte Transformers te evenaren onder identieke totale parameterbudgetten en trainings-tokens. DECO maakt gebruik van de differentieerbare en flexibele ReLU-gebaseerde routering, versterkt door leerbare expert-specifieke schaling, die de bijdragen van gerouteerde en gedeelde experts adaptief in evenwicht brengt. Verder introduceren we NormSiLU, een activatiefunctie die invoer normaliseert vóór SiLU-operatoren, wat leidt tot een stabielere trend van de activatieverhouding van gerouteerde experts en een hoger intrinsiek schaarste-niveau. We identificeren ook een empirisch voordeel bij het gebruik van niet-gegate MLP-experts met ReLU-gebaseerde routering, wat wijst op de mogelijkheid van vereenvoudiging van de MoE-architectuur. Experimenten tonen aan dat DECO, met activatie van slechts 20% van de experts, de prestaties van dichte modellen evenaart en gevestigde MoE-baselines overtreft. Onze gespecialiseerde versnellingskern levert een 3,00 maal versnelling op echte hardware vergeleken met dichte inferentie. Codes en checkpoints worden vrijgegeven.
English
While Mixture-of-Experts (MoE) scales model capacity without proportionally increasing computation, its massive total parameter footprint creates significant storage and memory-access bottlenecks, which hinder efficient end-side deployment that simultaneously requires high performance, low computational cost, and small storage overhead. To achieve these properties, we present DECO, a sparse MoE architecture designed to match the performance of dense Transformers under identical total parameter budgets and training tokens. DECO utilizes the differentiable and flexible ReLU-based routing enhanced by learnable expert-wise scaling, which adaptively balances the contributions of routed and shared experts. Furthermore, we introduce NormSiLU, an activation function that normalizes inputs prior to SiLU operators, producing a more stable trend of routed-expert activation ratio and a higher intrinsic sparsity level. We also identify an empirical advantage in using non-gated MLP experts with ReLU-based routing, indicating the possibility of MoE architecture simplification. Experiments demonstrate that DECO, activating only 20% of experts, matches dense performance and outperforms established MoE baselines. Our specialized acceleration kernel delivers a 3.00times speedup on real hardware compared with dense inference. Codes and checkpoints will be released.