MANCE: Стирание концептов с учетом многообразия
MANCE: Manifold Aware Concept Erasure
July 4, 2026
Авторы: Matan Avitan, Yoav Goldberg, Yanai Elazar
cs.AI
Аннотация
Концептуальное удаление направлено на удаление целевого концепта из представления с сохранением другой закодированной в нем информации. Это сложно, поскольку представления кодируют множество концептов, часто коррелирующих с целью удаления, так что удаление цели может повредить их. Мы предлагаем гипотезу ограничения многообразием (Manifold Constraint Hypothesis, MCH): если естественные представления концентрируются на структурированном многообразии меньшей размерности, то вмешательства следует ограничивать этим многообразием, что позволит лучше сохранять другую информацию, закодированную в представлении, в ходе таких вмешательств. Мы реализуем MCH в новом методе концептуального удаления: MANifold aware Concept Erasure (MANCE). MANCE выполняет итеративные обновления представлений, используя сигналы от классификатора, предсказывающего целевой концепт. Мы оцениваем многообразие на основе представлений, полученных из естественных входных данных, а затем проецируем обновление удаления концепта на это оцененное многообразие. Мы проводим обширную оценку на 119 конфигурациях, охватывающих текст и изображения, включая 13 языковых моделей, три концепта обработки естественного языка и 40 атрибутов CelebA-CLIP. Применение MANCE поверх предыдущих методов показывает последовательное улучшение результатов по утечке. Мы также представляем MANCE+ и MANCE++, которые предваряют использование MANCE алгоритмом удаления в замкнутой форме, достигая лучших компромиссов между утечкой и аккуратностью по сравнению с сопоставимыми обновлениями в полном пространстве. MANCE++, наш лучший метод, достигает самых современных результатов по нелинейному концептуальному удалению. Эти результаты подтверждают MCH в контексте удаления: вмешательства должны быть ограничены естественным многообразием представлений.
English
Concept erasure aims to remove a target concept from a representation while preserving the other information encoded in it. This is difficult because representations encode many concepts that are often correlated with the erasure target, so removing the target risks damaging them. We propose the Manifold Constraint Hypothesis (MCH): if natural representations concentrate on a structured, lower-dimensional manifold, then interventions should be constrained to that manifold and better preserve other information encoded in the representation during interventions. We instantiate MCH in a new concept erasure method: MANifold aware Concept Erasure (MANCE). MANCE performs iterative updates to the representations using signals from a classifier that predicts a target concept. We estimate the manifold using representations obtained from natural inputs, and then we project the concept removal update to the estimated manifold. We perform extensive evaluation on 119 settings spanning text and vision, including 13 language models, three NLP concepts, and 40 CelebA-CLIP attributes. Employing MANCE on top of previous methods shows consistent improved leakage results. We also introduce MANCE+ and MANCE++, which prepend a closed-form erasure algorithm before employing MANCE, achieving better leakage--surgicality tradeoffs relative to matched full-space updates. MANCE++, our best method, achieves state-of-the-art results on nonlinear concept erasure. These results support MCH in the erasure setting: interventions should be constrained to the natural representation manifold.