Ajuste de Identidade Latente em Modelos de Personalização de Texto para Imagem
Latent-Identity Tuning in Text-to-Image Personalization Models
July 13, 2026
Autores: Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik
cs.AI
Resumo
Gerar e editar o rosto de uma pessoa exige alta precisão, pois mesmo modificações menores podem alterar significativamente a identidade percebida de um sujeito. No entanto, os métodos atuais de personalização e edição baseados em modelos de texto para imagem de propósito geral frequentemente carecem da precisão necessária para edições faciais detalhadas. Apresentamos um método para ajuste fino de identidade em modelos de personalização de texto para imagem. Diferentemente da edição de imagem padrão, que opera sobre uma imagem fornecida, o ajuste de identidade modifica a representação latente de uma identidade específica, permitindo a geração de diversas imagens que retratam consistentemente a mesma identidade editada. Para permitir o ajuste fino da identidade latente, exploramos o espaço latente de um codificador pré-treinado e congelado para personalização de texto para imagem. Nossa abordagem não requer treinamento adicional. Em vez disso, ela aproveita a arquitetura existente de um codificador congelado para revelar direções semânticas latentes. Esse espaço consiste em um conjunto de tokens latentes que desempenham papéis distintos na captura de diferentes aspectos de uma identidade e frequentemente correspondem a regiões faciais espaciais ou semânticas específicas. Mostramos que direções significativas podem ser identificadas dentro desse espaço e dentro de subespaços definidos por tokens selecionados, possibilitando edições localizadas, detalhadas e semanticamente coerentes. Validamos nossa abordagem por meio de experimentos qualitativos e quantitativos que demonstram diversas edições faciais localizadas, preservando a consistência da identidade entre imagens. Página do projeto em: https://garibida.github.io/IdentityTuning/
English
Generating and editing a person's face demands high precision, as even minor modifications can significantly alter a subject's perceived identity. Current personalization and editing methods built on general-purpose text-to-image models, however, often lack the precision required for fine-grained facial edits. We present a method for fine-grained identity tuning in text-to-image personalization models. Unlike standard image editing, which operates on a given image, identity tuning modifies the latent representation of a specific identity, enabling the generation of diverse images that consistently depict the same edited identity. To enable fine-grained latent identity tuning, we explore the latent space of a pre-trained, frozen encoder for text-to-image personalization. Our approach requires no additional training. Instead, it leverages the existing architecture of a frozen encoder to uncover latent semantic directions. This space consists of a set of latent tokens that play distinct roles in capturing different aspects of an identity and often correspond to specific spatial or semantic facial regions. We show that meaningful directions can be identified within this space and within subspaces defined by selected tokens, enabling localized, fine-grained, and semantically coherent edits. We validate our approach through qualitative and quantitative experiments that demonstrate diverse localized facial edits while preserving cross-image identity consistency. Project page at: https://garibida.github.io/IdentityTuning/