ChatPaper.aiChatPaper

Um único neurônio é suficiente para contornar o alinhamento de segurança em Grandes Modelos de Linguagem.

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

May 8, 2026
Autores: Hamid Kazemi, Atoosa Chegini, Maria Safi
cs.AI

Resumo

O alinhamento de segurança em modelos de linguagem opera por meio de dois sistemas mecanicamente distintos: neurônios de recusa, que controlam se o conhecimento prejudicial é expresso, e neurônios de conceito, que codificam o próprio conhecimento prejudicial. Ao visar um único neurônio em cada sistema, demonstramos ambas as direções de falha — contornando a segurança em solicitações explícitas prejudiciais via supressão, e induzindo conteúdo prejudicial a partir de prompts inocentes via amplificação — em sete modelos abrangendo duas famílias e de 1,7B a 70B parâmetros, sem qualquer treinamento ou engenharia de prompts. Nossos achados sugerem que o alinhamento de segurança não está robustamente distribuído pelos pesos do modelo, mas é mediado por neurônios individuais, cada um causalmente suficiente para controlar o comportamento de recusa — suprimir qualquer um dos neurônios de recusa identificados contorna o alinhamento de segurança em diversas solicitações prejudiciais.
English
Safety alignment in language models operates through two mechanistically distinct systems: refusal neurons that gate whether harmful knowledge is expressed, and concept neurons that encode the harmful knowledge itself. By targeting a single neuron in each system, we demonstrate both directions of failure -- bypassing safety on explicit harmful requests via suppression, and inducing harmful content from innocent prompts via amplification -- across seven models spanning two families and 1.7B to 70B parameters, without any training or prompt engineering. Our findings suggest that safety alignment is not robustly distributed across model weights but is mediated by individual neurons that are each causally sufficient to gate refusal behavior -- suppressing any one of the identified refusal neurons bypasses safety alignment across diverse harmful requests.