Escalonamento de Aprendizado Contínuo para Mais de 300 Tarefas com Mistura de Especialistas de Roteamento Bi-Nível
Scaling Continual Learning to 300+ Tasks with Bi-Level Routing Mixture-of-Experts
May 8, 2026
Autores: Meng Lou, Yunxiang Fu, Yizhou Yu
cs.AI
Resumo
Aprendizado contínuo, especialmente o aprendizado incremental de classes (CIL), com base em um modelo pré-treinado (PTM) tem despertado substancial interesse de pesquisa nos últimos anos. No entanto, como aprender de forma eficaz representações de características tanto discriminativas quanto abrangentes, mantendo estabilidade e plasticidade ao longo de sequências de tarefas muito longas, ainda é um problema em aberto. Propomos o CaRE, um {A}prendiz {C}ontínuo escalável com {R}oteamento Eficiente de dois níveis baseado em {E}specialistas Misturados (BR-MoE). A ideia central do BR-MoE é um mecanismo de roteamento de dois níveis: um estágio de seleção de roteadores que ativa dinamicamente roteadores específicos de tarefas relevantes, seguido por uma fase de roteamento de especialistas que ativa e agrega especialistas dinamicamente, com o objetivo de injetar representações discriminativas e abrangentes em cada camada intermediária da rede. Por outro lado, introduzimos um conjunto de dados desafiador, o OmniBenchmark-1K, para avaliação de desempenho de CIL em sequências de tarefas muito longas, com centenas de tarefas. Experimentos extensivos mostram que o CaRE demonstra desempenho líder em diversos conjuntos de dados e configurações de tarefas, incluindo conjuntos de dados CIL comumente usados com configurações CIL clássicas (por exemplo, 5-20 tarefas). Até onde sabemos, o CaRE é o primeiro aprendiz contínuo que escala para sequências de tarefas muito longas (variando de 100 a mais de 300 tarefas não sobrepostas), superando todas as linhas de base com ampla margem em tais sequências de tarefas. Esperamos que este trabalho inspire futuras pesquisas em aprendizado contínuo ao longo de sequências de tarefas extremamente longas. O código e o conjunto de dados são disponibilizados publicamente em https://github.com/LMMMEng/CaRE.
English
Continual learning, especially class-incremental learning (CIL), on the basis of a pre-trained model (PTM) has garnered substantial research interest in recent years. However, how to effectively learn both discriminative and comprehensive feature representations while maintaining stability and plasticity over very long task sequences remains an open problem. We propose CaRE, a scalable {C}ontinual Le{a}rner with efficient Bi-Level {R}outing Mixture-of-{E}xperts (BR-MoE). The core idea of BR-MoE is a bi-level routing mechanism: a router selection stage that dynamically activates relevant task-specific routers, followed by an expert routing phase that dynamically activates and aggregates experts, aiming to inject discriminative and comprehensive representations into every intermediate network layer. On the other hand, we introduce a challenging dataset, OmniBenchmark-1K, for CIL performance evaluation on very long task sequences with hundreds of tasks. Extensive experiments show that CaRE demonstrates leading performance across a variety of datasets and task settings, including commonly used CIL datasets with classical CIL settings (e.g., 5-20 tasks). To the best of our knowledge, CaRE is the first continual learner that scales to very long task sequences (ranging from 100 to over 300 non-overlapping tasks), while outperforming all baselines by a large margin on such task sequences. We hope that this work will inspire further research into continual learning over extremely long task sequences. Code and dataset are publicly released at https://github.com/LMMMEng/CaRE.