ChatPaper.aiChatPaper

MANCE: Eliminación de Conceptos Consciente de la Variedad

MANCE: Manifold Aware Concept Erasure

July 4, 2026
Autores: Matan Avitan, Yoav Goldberg, Yanai Elazar
cs.AI

Resumen

La eliminación de conceptos tiene como objetivo eliminar un concepto objetivo de una representación mientras se preserva la otra información codificada en ella. Esto es difícil porque las representaciones codifican muchos conceptos que a menudo están correlacionados con el objetivo de eliminación, por lo que eliminar el objetivo corre el riesgo de dañarlos. Proponemos la Hipótesis de Restricción de la Variedad (MCH por sus siglas en inglés): si las representaciones naturales se concentran en una variedad estructurada de menor dimensión, entonces las intervenciones deberían restringirse a esa variedad y preservar mejor otra información codificada en la representación durante las intervenciones. Concretamos MCH en un nuevo método de eliminación de conceptos: Eliminación de Conceptos Consciente de la Variedad (MANCE). MANCE realiza actualizaciones iterativas a las representaciones utilizando señales de un clasificador que predice un concepto objetivo. Estimamos la variedad utilizando representaciones obtenidas de entradas naturales, y luego proyectamos la actualización de eliminación del concepto en la variedad estimada. Realizamos una evaluación exhaustiva en 119 configuraciones que abarcan texto y visión, incluyendo 13 modelos de lenguaje, tres conceptos de PLN y 40 atributos de CelebA-CLIP. El uso de MANCE sobre métodos anteriores muestra resultados de fuga consistentemente mejorados. También presentamos MANCE+ y MANCE++, que anteponen un algoritmo de eliminación de forma cerrada antes de emplear MANCE, logrando mejores compensaciones entre fuga y precisión quirúrgica en comparación con actualizaciones de espacio completo equivalentes. MANCE++, nuestro mejor método, logra resultados de última generación en eliminación de conceptos no lineales. Estos resultados respaldan la MCH en el contexto de eliminación: las intervenciones deben restringirse a la variedad de representación natural.
English
Concept erasure aims to remove a target concept from a representation while preserving the other information encoded in it. This is difficult because representations encode many concepts that are often correlated with the erasure target, so removing the target risks damaging them. We propose the Manifold Constraint Hypothesis (MCH): if natural representations concentrate on a structured, lower-dimensional manifold, then interventions should be constrained to that manifold and better preserve other information encoded in the representation during interventions. We instantiate MCH in a new concept erasure method: MANifold aware Concept Erasure (MANCE). MANCE performs iterative updates to the representations using signals from a classifier that predicts a target concept. We estimate the manifold using representations obtained from natural inputs, and then we project the concept removal update to the estimated manifold. We perform extensive evaluation on 119 settings spanning text and vision, including 13 language models, three NLP concepts, and 40 CelebA-CLIP attributes. Employing MANCE on top of previous methods shows consistent improved leakage results. We also introduce MANCE+ and MANCE++, which prepend a closed-form erasure algorithm before employing MANCE, achieving better leakage--surgicality tradeoffs relative to matched full-space updates. MANCE++, our best method, achieves state-of-the-art results on nonlinear concept erasure. These results support MCH in the erasure setting: interventions should be constrained to the natural representation manifold.