ChatPaper.aiChatPaper

Vers une compréhension de la robustesse des auto-encodeurs parcimonieux

Towards Understanding the Robustness of Sparse Autoencoders

April 20, 2026
Auteurs: Ahson Saiyed, Sabrina Sadiekh, Chirag Agarwal
cs.AI

Résumé

Les modèles de langage de grande taille (LLM) restent vulnérables aux attaques de contournement basées sur l'optimisation qui exploitent la structure interne du gradient. Bien que les autoencodeurs épars (SAE) soient largement utilisés pour l'interprétabilité, leurs implications en matière de robustesse demeurent peu explorées. Nous présentons une étude sur l'intégration de SAE pré-entraînés dans les flux résiduels des transformers au moment de l'inférence, sans modifier les poids du modèle ni bloquer les gradients. Sur quatre familles de modèles (Gemma, LLaMA, Mistral, Qwen) et avec deux attaques en boîte blanche robustes (GCG, BEAST) plus trois benchmarks en boîte noire, les modèles augmentés par SAE atteignent une réduction jusqu'à 5 fois du taux de réussite des contournements par rapport à la ligne de base non défendue et réduisent la transférabilité des attaques entre modèles. Des ablations paramétriques révèlent (i) une relation dose-réponse monotone entre la parcimonie L0 et le taux de réussite des attaques, et (ii) un compromis défense-utilité dépendant de la couche, où les couches intermédiaires équilibrent robustesse et performance nominale. Ces résultats sont cohérents avec l'hypothèse du goulot d'étranglement représentationnel : la projection parcimonieuse remodelerait la géométrie d'optimisation exploitée par les attaques de contournement.
English
Large Language Models (LLMs) remain vulnerable to optimization-based jailbreak attacks that exploit internal gradient structure. While Sparse Autoencoders (SAEs) are widely used for interpretability, their robustness implications remain underexplored. We present a study of integrating pretrained SAEs into transformer residual streams at inference time, without modifying model weights or blocking gradients. Across four model families (Gemma, LLaMA, Mistral, Qwen) and two strong white-box attacks (GCG, BEAST) plus three black-box benchmarks, SAE-augmented models achieve up to a 5x reduction in jailbreak success rate relative to the undefended baseline and reduce cross-model attack transferability. Parametric ablations reveal (i) a monotonic dose-response relationship between L0 sparsity and attack success rate, and (ii) a layer-dependent defense-utility tradeoff, where intermediate layers balance robustness and clean performance. These findings are consistent with a representational bottleneck hypothesis: sparse projection reshapes the optimization geometry exploited by jailbreak attacks.