ChatPaper.aiChatPaper

Dualidade Prompt-Ativação: Melhorando o Direcionamento de Ativação por meio de Intervenções no Nível de Atenção

Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions

May 11, 2026
Autores: Diancheng Kang, Zheyuan Liu, Ningshan Ma, Yue Huang, Zhaoxuan Tan, Meng Jiang
cs.AI

Resumo

O direcionamento de ativação controla o comportamento de modelos de linguagem ao adicionar direções às representações internas durante a inferência, mas o direcionamento padrão do fluxo residual pode falhar em diálogos com estado. Identificamos a contaminação do cache KV como um modo de falha chave: os estados dos tokens direcionados são armazenados e reutilizados repetidamente, transformando uma perturbação local em uma degradação cumulativa da coerência. Para enfrentar esse desafio, propomos o Direcionamento de Delta de Atenção com Recorte e Porta (Gated Cropped Attention-Delta steering, GCAD), que extrai sinais de direcionamento das contribuições do prompt de sistema para a autoatenção e os aplica com portas em nível de token. Em experimentos de direcionamento de persona, o GCAD preserva o controle de traços enquanto melhora substancialmente a coerência de longo horizonte. No principal referencial de múltiplas rodadas, o GCAD melhora a deriva média de coerência de -18,6 para -1,9 e eleva a expressão de traço na décima rodada de 78,0 para 93,1. Esses resultados sugerem que o direcionamento de ativação se torna mais confiável quando as intervenções seguem as vias mediadas por prompts que os modelos já utilizam para o controle comportamental.
English
Activation steering controls language model behavior by adding directions to internal representations at inference time, but standard residual-stream steering can fail in stateful dialogue. We identify KV-cache contamination as a key failure mode: steered token states are stored and repeatedly reused, turning a local perturbation into cumulative coherence degradation. To address this challenge, we propose Gated Cropped Attention-Delta steering (GCAD), which extracts steering signals from system-prompt contributions to self-attention and applies them with token-level gating. Across persona-steering experiments, GCAD preserves trait control while substantially improving long-horizon coherence. On the main multi-turn benchmark, GCAD improves average coherence drift from -18.6 to -1.9 and raises turn-10 trait expression from 78.0 to 93.1. These results suggest that activation steering becomes more reliable when interventions follow the prompt-mediated pathways that models already use for behavioral control.