ChatPaper.aiChatPaper

Un seul neurone suffit pour contourner l'alignement de sécurité dans les grands modèles de langage.

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

May 8, 2026
Auteurs: Hamid Kazemi, Atoosa Chegini, Maria Safi
cs.AI

Résumé

L'alignement de sécurité dans les modèles de langage repose sur deux systèmes mécanistiquement distincts : les neurones de refus, qui régulent l'expression des connaissances nuisibles, et les neurones de concept, qui encodent ces connaissances elles-mêmes. En ciblant un seul neurone dans chaque système, nous démontrons les deux directions de défaillance — contourner la sécurité face à des demandes explicitement nuisibles par suppression, et induire un contenu nuisible à partir de requêtes innocentes par amplification — à travers sept modèles de deux familles, de 1,7 à 70 milliards de paramètres, sans aucun entraînement ni ingénierie de prompt. Nos résultats suggèrent que l'alignement de sécurité n'est pas robustement distribué à travers les poids du modèle, mais qu'il est médié par des neurones individuels, chacun causalement suffisant pour verrouiller le comportement de refus — la suppression d'un seul des neurones de refus identifiés contourne l'alignement de sécurité face à diverses demandes nuisibles.
English
Safety alignment in language models operates through two mechanistically distinct systems: refusal neurons that gate whether harmful knowledge is expressed, and concept neurons that encode the harmful knowledge itself. By targeting a single neuron in each system, we demonstrate both directions of failure -- bypassing safety on explicit harmful requests via suppression, and inducing harmful content from innocent prompts via amplification -- across seven models spanning two families and 1.7B to 70B parameters, without any training or prompt engineering. Our findings suggest that safety alignment is not robustly distributed across model weights but is mediated by individual neurons that are each causally sufficient to gate refusal behavior -- suppressing any one of the identified refusal neurons bypasses safety alignment across diverse harmful requests.