Naar het begrijpen van de robuustheid van sparse autoencoders
Towards Understanding the Robustness of Sparse Autoencoders
April 20, 2026
Auteurs: Ahson Saiyed, Sabrina Sadiekh, Chirag Agarwal
cs.AI
Samenvatting
Grote Taalmodellen (LLM's) blijven kwetsbaar voor optimalisatiegebaseerde jailbreak-aanvallen die gebruikmaken van de interne gradiëntstructuur. Hoewel Sparse Autoencoders (SAE's) breed worden ingezet voor interpreteerbaarheid, zijn de implicaties voor robuustheid nog onvoldoende onderzocht. We presenteren een onderzoek naar het integreren van voorgetrainde SAE's in transformer residuele stromen tijdens inferentie, zonder modelgewichten aan te passen of gradiënten te blokkeren. Over vier modelfamilies (Gemma, LLaMA, Mistral, Qwen) en twee sterke white-box-aanvallen (GCG, BEAST) plus drie black-box-benchmarks heen, behalen SAE-verbeterde modellen tot een vijfvoudige reductie in het jailbreak-succespercentage ten opzichte van de onverdedigde basislijn en verminderen ze de overdraagbaarheid van aanvallen tussen modellen. Parametrische ablaties tonen (i) een monotone dosis-responsrelatie aan tussen L0-schaarste en het aanvalssuccespercentage, en (ii) een laagafhankelijke afweging tussen verdediging en nut, waarbij tussenliggende lagen een balans vinden tussen robuustheid en schone prestaties. Deze bevindingen komen overeen met een representatieknelpunthypothese: schaarse projectie hervormt de optimalisatiegeometrie die door jailbreak-aanvallen wordt uitgebuit.
English
Large Language Models (LLMs) remain vulnerable to optimization-based jailbreak attacks that exploit internal gradient structure. While Sparse Autoencoders (SAEs) are widely used for interpretability, their robustness implications remain underexplored. We present a study of integrating pretrained SAEs into transformer residual streams at inference time, without modifying model weights or blocking gradients. Across four model families (Gemma, LLaMA, Mistral, Qwen) and two strong white-box attacks (GCG, BEAST) plus three black-box benchmarks, SAE-augmented models achieve up to a 5x reduction in jailbreak success rate relative to the undefended baseline and reduce cross-model attack transferability. Parametric ablations reveal (i) a monotonic dose-response relationship between L0 sparsity and attack success rate, and (ii) a layer-dependent defense-utility tradeoff, where intermediate layers balance robustness and clean performance. These findings are consistent with a representational bottleneck hypothesis: sparse projection reshapes the optimization geometry exploited by jailbreak attacks.