ChatPaper.aiChatPaper

Настройка латентной идентичности в моделях персонализации генерации изображений по тексту

Latent-Identity Tuning in Text-to-Image Personalization Models

July 13, 2026
Авторы: Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik
cs.AI

Аннотация

Генерация и редактирование лица человека требуют высокой точности, поскольку даже незначительные изменения могут существенно повлиять на воспринимаемую идентичность субъекта. Современные методы персонализации и редактирования, основанные на универсальных моделях «текст-в-изображение», зачастую не обладают необходимой точностью для тонкой правки черт лица. Мы представляем метод точной настройки идентичности в моделях персонализации «текст-в-изображение». В отличие от стандартного редактирования изображений, которое работает с заданным снимком, настройка идентичности изменяет латентное представление конкретной идентичности, позволяя генерировать разнообразные изображения, последовательно изображающие одну и ту же отредактированную личность. Для обеспечения тонкой латентной настройки идентичности мы исследуем латентное пространство предварительно обученного замороженного кодировщика для персонализации «текст-в-изображение». Наш подход не требует дополнительного обучения. Вместо этого он использует существующую архитектуру замороженного кодировщика для выявления латентных семантических направлений. Это пространство состоит из набора латентных токенов, которые играют различные роли в захвате разных аспектов идентичности и часто соответствуют конкретным пространственным или семантическим областям лица. Мы показываем, что в этом пространстве и в подпространствах, определяемых выбранными токенами, можно идентифицировать значимые направления, что позволяет выполнять локализованные, тонкие и семантически согласованные правки. Мы подтверждаем наш подход качественными и количественными экспериментами, демонстрирующими разнообразные локализованные правки лица с сохранением согласованности идентичности между разными изображениями. Страница проекта: https://garibida.github.io/IdentityTuning/
English
Generating and editing a person's face demands high precision, as even minor modifications can significantly alter a subject's perceived identity. Current personalization and editing methods built on general-purpose text-to-image models, however, often lack the precision required for fine-grained facial edits. We present a method for fine-grained identity tuning in text-to-image personalization models. Unlike standard image editing, which operates on a given image, identity tuning modifies the latent representation of a specific identity, enabling the generation of diverse images that consistently depict the same edited identity. To enable fine-grained latent identity tuning, we explore the latent space of a pre-trained, frozen encoder for text-to-image personalization. Our approach requires no additional training. Instead, it leverages the existing architecture of a frozen encoder to uncover latent semantic directions. This space consists of a set of latent tokens that play distinct roles in capturing different aspects of an identity and often correspond to specific spatial or semantic facial regions. We show that meaningful directions can be identified within this space and within subspaces defined by selected tokens, enabling localized, fine-grained, and semantically coherent edits. We validate our approach through qualitative and quantitative experiments that demonstrate diverse localized facial edits while preserving cross-image identity consistency. Project page at: https://garibida.github.io/IdentityTuning/