ChatPaper.aiChatPaper

Dommages Cérébraux Maximaux Sans Données ni Optimisation : Perturbation des Réseaux de Neurones par Inversion des Bits de Signe

Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flips

April 16, 2026
Auteurs: Ido Galil, Moshe Kimhi, Ran El-Yaniv
cs.AI

Résumé

Les réseaux neuronaux profonds (DNN) peuvent être catastrophiquement perturbés en inversant seulement une poignée de bits de paramètres. Nous présentons Deep Neural Lesion (DNL), une méthode sans données et sans optimisation qui localise les paramètres critiques, et une variante améliorée en une seule passe, 1P-DNL, qui affine cette sélection avec une passe avant et une passe arrière sur des entrées aléatoires. Nous montrons que cette vulnérabilité s'étend à de multiples domaines, incluant la classification d'images, la détection d'objets, la segmentation d'instances et les grands modèles de langage pour le raisonnement. Dans la classification d'images, l'inversion de seulement deux bits de signe dans ResNet-50 sur ImageNet réduit la précision de 99,8 %. Dans la détection d'objets et la segmentation d'instances, l'inversion d'un ou deux bits de signe dans le backbone fait s'effondrer les AP de détection et de masque COCO pour les modèles Mask R-CNN et YOLOv8-seg. En modélisation du langage, l'inversion de deux bits de signe dans différents experts réduit la précision de Qwen3-30B-A3B-Thinking de 78 % à 0 %. Nous montrons également que la protection sélective d'une petite fraction des bits de signe vulnérables offre une défense pratique contre de telles attaques.
English
Deep Neural Networks (DNNs) can be catastrophically disrupted by flipping only a handful of parameter bits. We introduce Deep Neural Lesion (DNL), a data-free and optimizationfree method that locates critical parameters, and an enhanced single-pass variant, 1P-DNL, that refines this selection with one forward and backward pass on random inputs. We show that this vulnerability spans multiple domains, including image classification, object detection, instance segmentation, and reasoning large language models. In image classification, flipping just two sign bits in ResNet-50 on ImageNet reduces accuracy by 99.8%. In object detection and instance segmentation, one or two sign flips in the backbone collapse COCO detection and mask AP for Mask R-CNN and YOLOv8-seg models. In language modeling, two sign flips into different experts reduce Qwen3-30B-A3B-Thinking from 78% to 0% accuracy. We also show that selectively protecting a small fraction of vulnerable sign bits provides a practical defense against such attacks.