Eén enkel neuron volstaat om de veiligheidsuitlijning in grote taalmodellen te omzeilen.
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
May 8, 2026
Auteurs: Hamid Kazemi, Atoosa Chegini, Maria Safi
cs.AI
Samenvatting
Veiligheidsuitlijning in taalmodellen werkt via twee mechanistisch verschillende systemen: weigeringsneuronen die bepalen of schadelijke kennis wordt geuit, en conceptneuronen die de schadelijke kennis zelf coderen. Door een enkel neuron in elk systeem te targeten, tonen we beide faalrichtingen aan – het omzeilen van veiligheid bij expliciete schadelijke verzoeken via onderdrukking, en het induceren van schadelijke inhoud uit onschuldige prompts via versterking – in zeven modellen uit twee families en met 1,7B tot 70B parameters, zonder enige training of prompt engineering. Onze bevindingen suggereren dat veiligheidsuitlijning niet robuust is verdeeld over modelgewichten, maar wordt gemedieerd door individuele neuronen die elk causaal voldoende zijn om weigeringsgedrag te sturen – het onderdrukken van een van de geïdentificeerde weigeringsneuronen omzeilt veiligheidsuitlijning bij uiteenlopende schadelijke verzoeken.
English
Safety alignment in language models operates through two mechanistically distinct systems: refusal neurons that gate whether harmful knowledge is expressed, and concept neurons that encode the harmful knowledge itself. By targeting a single neuron in each system, we demonstrate both directions of failure -- bypassing safety on explicit harmful requests via suppression, and inducing harmful content from innocent prompts via amplification -- across seven models spanning two families and 1.7B to 70B parameters, without any training or prompt engineering. Our findings suggest that safety alignment is not robustly distributed across model weights but is mediated by individual neurons that are each causally sufficient to gate refusal behavior -- suppressing any one of the identified refusal neurons bypasses safety alignment across diverse harmful requests.