MANCE : Effacement de concept conscient des variétés
MANCE: Manifold Aware Concept Erasure
July 4, 2026
Auteurs: Matan Avitan, Yoav Goldberg, Yanai Elazar
cs.AI
Résumé
L'effacement de concept vise à supprimer un concept cible d'une représentation tout en préservant les autres informations qui y sont encodées. Cela est difficile car les représentations encodent de nombreux concepts souvent corrélés avec la cible d'effacement, de sorte que la suppression de cette cible risque de les endommager. Nous proposons l'Hypothèse de Contrainte de Variété (HCV) : si les représentations naturelles se concentrent sur une variété structurée de dimension inférieure, alors les interventions devraient être contraintes à cette variété et mieux préserver les autres informations encodées dans la représentation lors des interventions. Nous concrétisons l'HCV dans une nouvelle méthode d'effacement de concept : l'Effacement de Concept Sensible à la Variété (MANCE). MANCE effectue des mises à jour itératives des représentations à l'aide des signaux d'un classifieur qui prédit un concept cible. Nous estimons la variété à l'aide des représentations obtenues à partir d'entrées naturelles, puis nous projetons la mise à jour de suppression du concept sur la variété estimée. Nous effectuons une évaluation exhaustive sur 119 configurations couvrant le texte et la vision, incluant 13 modèles de langage, trois concepts de NLP et 40 attributs CelebA-CLIP. L'utilisation de MANCE en complément des méthodes précédentes montre des résultats d'amélioration constante des fuites. Nous introduisons également MANCE+ et MANCE++, qui préfixent un algorithme d'effacement sous forme fermée avant d'employer MANCE, obtenant de meilleurs compromis entre fuite et précision chirurgicale par rapport aux mises à jour équivalentes dans l'espace complet. MANCE++, notre meilleure méthode, atteint des résultats de pointe sur l'effacement non linéaire de concepts. Ces résultats soutiennent l'HCV dans le contexte de l'effacement : les interventions devraient être contraintes à la variété naturelle des représentations.
English
Concept erasure aims to remove a target concept from a representation while preserving the other information encoded in it. This is difficult because representations encode many concepts that are often correlated with the erasure target, so removing the target risks damaging them. We propose the Manifold Constraint Hypothesis (MCH): if natural representations concentrate on a structured, lower-dimensional manifold, then interventions should be constrained to that manifold and better preserve other information encoded in the representation during interventions. We instantiate MCH in a new concept erasure method: MANifold aware Concept Erasure (MANCE). MANCE performs iterative updates to the representations using signals from a classifier that predicts a target concept. We estimate the manifold using representations obtained from natural inputs, and then we project the concept removal update to the estimated manifold. We perform extensive evaluation on 119 settings spanning text and vision, including 13 language models, three NLP concepts, and 40 CelebA-CLIP attributes. Employing MANCE on top of previous methods shows consistent improved leakage results. We also introduce MANCE+ and MANCE++, which prepend a closed-form erasure algorithm before employing MANCE, achieving better leakage--surgicality tradeoffs relative to matched full-space updates. MANCE++, our best method, achieves state-of-the-art results on nonlinear concept erasure. These results support MCH in the erasure setting: interventions should be constrained to the natural representation manifold.