MASCing: Comportamento Configurável de Mistura de Especialistas via Máscaras de Direcionamento de Ativação
MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks
April 30, 2026
Autores: Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek
cs.AI
Resumo
As arquiteturas Mixture-of-Experts (MoE) em Modelos de Linguagem de Grande Porte (LLMs) reduziram significativamente os custos de inferência através da ativação esparsa. No entanto, este paradigma de ativação esparsa também introduz novos desafios de segurança. Uma vez que apenas um subconjunto de especialistas é ativado para cada entrada, o comportamento do modelo torna-se acoplado às decisões de roteamento, resultando num mecanismo de difícil controlo que pode variar entre cenários relevantes para a segurança. Ao mesmo tempo, adaptar o comportamento do modelo através de *fine-tuning* completo ou retreinamento é dispendioso, especialmente quando os desenvolvedores precisam de configurar rapidamente o mesmo modelo para diferentes objetivos de segurança. Apresentamos o MASCing (MoE Activation Steering Configuration), o primeiro *framework* que permite a reconfiguração flexível do comportamento MoE em diversos cenários de segurança sem retreinamento. O MASCing utiliza um modelo substituto baseado em LSTM para capturar dependências de roteamento entre camadas e mapear os *logits* de roteamento para comportamentos *downstream*. Em seguida, otimiza uma matriz de direcionamento para identificar circuitos de especialistas relevantes para o comportamento e, no momento da inferência, aplica máscaras de direcionamento aos *gates* de roteamento para substituir a seleção de especialistas. Isto permite o reforço ou supressão direcionada de comportamentos específicos, preservando a utilidade geral da linguagem. Para demonstrar a sua reconfigurabilidade, aplicamos o MASCing a dois objetivos diferentes relacionados com segurança e observamos ganhos consistentes com sobrecarga negligenciável em sete modelos MoE de código aberto. Para a defesa contra *jailbreak* multi-turn, melhora a taxa média de sucesso da defesa de 52,5% para 83,9%, com ganhos de até 89,2%. Para a geração de conteúdo adulto, o MASCing permite que os modelos cumpram tais solicitações que de outra forma seriam recusadas, aumentando a taxa média de sucesso de geração de 52,6% para 82,0%, com ganhos de até 93,0%. Estes resultados estabelecem o MASCing como um *framework* prático, leve e flexível para reconfiguração de segurança específica por cenário em modelos MoE.
English
Mixture-of-Experts (MoE) architectures in Large Language Models (LLMs) have significantly reduced inference costs through sparse activation. However, this sparse activation paradigm also introduces new safety challenges. Since only a subset of experts is engaged for each input, model behavior becomes coupled to routing decisions, yielding a difficult-to-control mechanism that can vary across safety-relevant scenarios. At the same time, adapting model behavior through full fine-tuning or retraining is costly, especially when developers need to rapidly configure the same model for different safety objectives. We present MASCing (MoE Activation Steering Configuration), the first framework that enables flexible reconfiguration of MoE behavior across diverse safety scenarios without retraining. MASCing uses an LSTM-based surrogate model to capture cross-layer routing dependencies and map routing logits to downstream behaviors. It then optimizes a steering matrix to identify behavior-relevant expert circuits and, at inference time, applies steering masks to the routing gates to override expert selection. This enables targeted enhancement or suppression of specific behaviors while preserving general language utility. To demonstrate its reconfigurability, we apply MASCing to two different safety-related objectives and observe consistent gains with negligible overhead across seven open-source MoE models. For multi-turn jailbreak defense, it improves the average defense success rate from 52.5% to 83.9%, with gains of up to 89.2%. For adult-content generation, MASCing enables models to comply with such requests that would otherwise be refused, increasing the average generation success rate from 52.6% to 82.0%, with gains of up to 93.0%. These results establish MASCing as a practical, lightweight, and flexible framework for scenario-specific safety reconfiguration in MoE models.