ChatPaper.aiChatPaper

DECO: Mistura Esparsa de Especialistas com Desempenho Comparável ao Denso em Dispositivos de Ponta

DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices

May 11, 2026
Autores: Chenyang Song, Weilin Zhao, Xu Han, Chaojun Xiao, Yingfa Chen, Zhiyuan Liu
cs.AI

Resumo

Embora a Mistura de Especialistas (MoE) escale a capacidade do modelo sem aumentar proporcionalmente o computo, sua enorme pegada total de parâmetros cria gargalos significativos de armazenamento e acesso à memória, que dificultam a implantação eficiente em dispositivos finais, que exige simultaneamente alto desempenho, baixo custo computacional e pequena sobrecarga de armazenamento. Para alcançar essas propriedades, apresentamos o DECO, uma arquitetura MoE esparsa projetada para igualar o desempenho de Transformers densos sob orçamentos de parâmetros totais e tokens de treinamento idênticos. O DECO utiliza o roteamento diferenciável e flexível baseado em ReLU, aprimorado por escalonamento por especialista ajustável, que equilibra adaptativamente as contribuições de especialistas roteados e compartilhados. Além disso, introduzimos a NormSiLU, uma função de ativação que normaliza as entradas antes dos operadores SiLU, produzindo uma tendência mais estável na taxa de ativação dos especialistas roteados e um nível intrínseco de esparsidade mais elevado. Também identificamos uma vantagem empírica no uso de especialistas MLP sem portão com roteamento baseado em ReLU, indicando a possibilidade de simplificação da arquitetura MoE. Experimentos demonstram que o DECO, ativando apenas 20% dos especialistas, iguala o desempenho denso e supera as bases de referência MoE estabelecidas. Nosso kernel de aceleração especializado proporciona uma aceleração de 3,00 vezes em hardware real em comparação com a inferência densa. Códigos e checkpoints serão disponibilizados.
English
While Mixture-of-Experts (MoE) scales model capacity without proportionally increasing computation, its massive total parameter footprint creates significant storage and memory-access bottlenecks, which hinder efficient end-side deployment that simultaneously requires high performance, low computational cost, and small storage overhead. To achieve these properties, we present DECO, a sparse MoE architecture designed to match the performance of dense Transformers under identical total parameter budgets and training tokens. DECO utilizes the differentiable and flexible ReLU-based routing enhanced by learnable expert-wise scaling, which adaptively balances the contributions of routed and shared experts. Furthermore, we introduce NormSiLU, an activation function that normalizes inputs prior to SiLU operators, producing a more stable trend of routed-expert activation ratio and a higher intrinsic sparsity level. We also identify an empirical advantage in using non-gated MLP experts with ReLU-based routing, indicating the possibility of MoE architecture simplification. Experiments demonstrate that DECO, activating only 20% of experts, matches dense performance and outperforms established MoE baselines. Our specialized acceleration kernel delivers a 3.00times speedup on real hardware compared with dense inference. Codes and checkpoints will be released.