ChatPaper.aiChatPaper

DECO : Mélange d'experts parcimonieux avec des performances comparables aux modèles denses sur des appareils terminaux

DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices

May 11, 2026
Auteurs: Chenyang Song, Weilin Zhao, Xu Han, Chaojun Xiao, Yingfa Chen, Zhiyuan Liu
cs.AI

Résumé

Alors que le mélange d'experts (MoE) permet d'augmenter la capacité du modèle sans accroître proportionnellement le calcul, son empreinte massive en paramètres totaux crée des goulots d'étranglement importants en termes de stockage et d'accès mémoire, ce qui entrave un déploiement efficace côté terminal nécessitant simultanément des performances élevées, un faible coût de calcul et une faible charge de stockage. Pour atteindre ces propriétés, nous présentons DECO, une architecture MoE éparse conçue pour égaler les performances des transformateurs denses sous des budgets de paramètres totaux et des jetons d'entraînement identiques. DECO utilise un routage flexible et différentiable basé sur ReLU, renforcé par une mise à l'échelle apprenable par expert, qui équilibre de manière adaptative les contributions des experts routés et partagés. De plus, nous introduisons NormSiLU, une fonction d'activation qui normalise les entrées avant les opérateurs SiLU, produisant une tendance plus stable du taux d'activation des experts routés et un niveau de parcimonie intrinsèque plus élevé. Nous identifions également un avantage empirique à utiliser des experts MLP non à portes avec un routage basé sur ReLU, ce qui suggère une possible simplification de l'architecture MoE. Les expériences montrent que DECO, n'activant que 20 % des experts, égale les performances des modèles denses et surpasse les références MoE établies. Notre noyau d'accélération spécialisé offre une accélération de 3,00 fois sur du matériel réel par rapport à l'inférence dense. Les codes et les points de contrôle seront publiés.
English
While Mixture-of-Experts (MoE) scales model capacity without proportionally increasing computation, its massive total parameter footprint creates significant storage and memory-access bottlenecks, which hinder efficient end-side deployment that simultaneously requires high performance, low computational cost, and small storage overhead. To achieve these properties, we present DECO, a sparse MoE architecture designed to match the performance of dense Transformers under identical total parameter budgets and training tokens. DECO utilizes the differentiable and flexible ReLU-based routing enhanced by learnable expert-wise scaling, which adaptively balances the contributions of routed and shared experts. Furthermore, we introduce NormSiLU, an activation function that normalizes inputs prior to SiLU operators, producing a more stable trend of routed-expert activation ratio and a higher intrinsic sparsity level. We also identify an empirical advantage in using non-gated MLP experts with ReLU-based routing, indicating the possibility of MoE architecture simplification. Experiments demonstrate that DECO, activating only 20% of experts, matches dense performance and outperforms established MoE baselines. Our specialized acceleration kernel delivers a 3.00times speedup on real hardware compared with dense inference. Codes and checkpoints will be released.