Réglage de l'identité latente dans les modèles de personnalisation texte-à-image
Latent-Identity Tuning in Text-to-Image Personalization Models
July 13, 2026
Auteurs: Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik
cs.AI
Résumé
Générer et éditer le visage d’une personne exige une grande précision, car même des modifications mineures peuvent altérer significativement l’identité perçue du sujet. Cependant, les méthodes actuelles de personnalisation et d’édition reposant sur des modèles texte-image à usage général manquent souvent de la précision nécessaire pour des modifications faciales à grain fin. Nous présentons une méthode d’ajustement d’identité à grain fin dans les modèles de personnalisation texte-image. Contrairement à l’édition d’image standard, qui opère sur une image donnée, l’ajustement d’identité modifie la représentation latente d’une identité spécifique, permettant ainsi de générer des images variées représentant de manière cohérente la même identité éditée. Pour permettre un ajustement latent d’identité à grain fin, nous explorons l’espace latent d’un encodeur pré-entraîné et gelé pour la personnalisation texte-image. Notre approche ne nécessite aucun entraînement supplémentaire. Elle exploite plutôt l’architecture existante d’un encodeur gelé pour découvrir des directions sémantiques latentes. Cet espace est constitué d’un ensemble de tokens latents qui jouent des rôles distincts dans la capture de différents aspects d’une identité et correspondent souvent à des régions faciales spatiales ou sémantiques spécifiques. Nous montrons que des directions pertinentes peuvent être identifiées dans cet espace ainsi que dans des sous-espaces définis par des tokens sélectionnés, permettant des modifications localisées, à grain fin et sémantiquement cohérentes. Nous validons notre approche par des expériences qualitatives et quantitatives qui démontrent diverses modifications faciales localisées tout en préservant la cohérence d’identité entre les images. Page du projet : https://garibida.github.io/IdentityTuning/
English
Generating and editing a person's face demands high precision, as even minor modifications can significantly alter a subject's perceived identity. Current personalization and editing methods built on general-purpose text-to-image models, however, often lack the precision required for fine-grained facial edits. We present a method for fine-grained identity tuning in text-to-image personalization models. Unlike standard image editing, which operates on a given image, identity tuning modifies the latent representation of a specific identity, enabling the generation of diverse images that consistently depict the same edited identity. To enable fine-grained latent identity tuning, we explore the latent space of a pre-trained, frozen encoder for text-to-image personalization. Our approach requires no additional training. Instead, it leverages the existing architecture of a frozen encoder to uncover latent semantic directions. This space consists of a set of latent tokens that play distinct roles in capturing different aspects of an identity and often correspond to specific spatial or semantic facial regions. We show that meaningful directions can be identified within this space and within subspaces defined by selected tokens, enabling localized, fine-grained, and semantically coherent edits. We validate our approach through qualitative and quantitative experiments that demonstrate diverse localized facial edits while preserving cross-image identity consistency. Project page at: https://garibida.github.io/IdentityTuning/