ChatPaper.aiChatPaper

Dualité prompt-activation : améliorer le guidage d'activation via des interventions au niveau de l'attention

Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions

May 11, 2026
Auteurs: Diancheng Kang, Zheyuan Liu, Ningshan Ma, Yue Huang, Zhaoxuan Tan, Meng Jiang
cs.AI

Résumé

Le guidage par activation contrôle le comportement des modèles de langage en ajoutant des directions aux représentations internes lors de l'inférence, mais le guidage standard par flux résiduel peut échouer dans un dialogue avec état. Nous identifions la contamination du cache KV comme un mode de défaillance clé : les états token guidés sont stockés et réutilisés de manière répétée, transformant une perturbation locale en une dégradation cumulative de la cohérence. Pour relever ce défi, nous proposons le guidage par delta d'attention rognée avec porte (GCAD), qui extrait les signaux de guidage des contributions de l'invite système à l'auto-attention et les applique avec un filtrage au niveau des tokens. Lors d'expériences de guidage de persona, GCAD préserve le contrôle des traits tout en améliorant considérablement la cohérence à long terme. Sur le principal benchmark multi-tours, GCAD améliore la dérive moyenne de cohérence de -18,6 à -1,9 et augmente l'expression du trait au 10e tour de 78,0 à 93,1. Ces résultats suggèrent que le guidage par activation devient plus fiable lorsque les interventions suivent les voies médiées par les invites que les modèles utilisent déjà pour le contrôle comportemental.
English
Activation steering controls language model behavior by adding directions to internal representations at inference time, but standard residual-stream steering can fail in stateful dialogue. We identify KV-cache contamination as a key failure mode: steered token states are stored and repeatedly reused, turning a local perturbation into cumulative coherence degradation. To address this challenge, we propose Gated Cropped Attention-Delta steering (GCAD), which extracts steering signals from system-prompt contributions to self-attention and applies them with token-level gating. Across persona-steering experiments, GCAD preserves trait control while substantially improving long-horizon coherence. On the main multi-turn benchmark, GCAD improves average coherence drift from -18.6 to -1.9 and raises turn-10 trait expression from 78.0 to 93.1. These results suggest that activation steering becomes more reliable when interventions follow the prompt-mediated pathways that models already use for behavioral control.