ChatPaper.aiChatPaper

Latente-identiteitstuning in tekst-naar-beeld personalisatiemodellen

Latent-Identity Tuning in Text-to-Image Personalization Models

July 13, 2026
Auteurs: Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik
cs.AI

Samenvatting

Het genereren en bewerken van iemands gezicht vereist hoge precisie, aangezien zelfs kleine wijzigingen de waargenomen identiteit van een persoon aanzienlijk kunnen veranderen. Huidige personalisatie- en bewerkingsmethoden die zijn gebaseerd op algemene tekst-naar-beeld modellen missen echter vaak de precisie die nodig is voor fijnmazige gezichtsbewerkingen. We presenteren een methode voor fijnmazige identiteitsafstemming in tekst-naar-beeld personalisatiemodellen. In tegenstelling tot standaard beeldbewerking, die werkt op een gegeven afbeelding, wijzigt identiteitsafstemming de latente representatie van een specifieke identiteit, waardoor de generatie van diverse afbeeldingen mogelijk wordt die consistent dezelfde bewerkte identiteit weergeven. Om fijnmazige latente identiteitsafstemming mogelijk te maken, verkennen we de latente ruimte van een vooraf getrainde, bevroren encoder voor tekst-naar-beeld personalisatie. Onze aanpak vereist geen extra training. In plaats daarvan maakt het gebruik van de bestaande architectuur van een bevroren encoder om latente semantische richtingen te ontdekken. Deze ruimte bestaat uit een set latente tokens die verschillende rollen spelen bij het vastleggen van verschillende aspecten van een identiteit en vaak overeenkomen met specifieke ruimtelijke of semantische gezichtsregio's. We laten zien dat betekenisvolle richtingen kunnen worden geïdentificeerd binnen deze ruimte en binnen deelruimten gedefinieerd door geselecteerde tokens, waardoor gelokaliseerde, fijnmazige en semantisch coherente bewerkingen mogelijk worden. We valideren onze aanpak door middel van kwalitatieve en kwantitatieve experimenten die diverse gelokaliseerde gezichtsbewerkingen demonstreren, terwijl de consistentie van de identiteit over afbeeldingen heen behouden blijft. Projectpagina op: https://garibida.github.io/IdentityTuning/
English
Generating and editing a person's face demands high precision, as even minor modifications can significantly alter a subject's perceived identity. Current personalization and editing methods built on general-purpose text-to-image models, however, often lack the precision required for fine-grained facial edits. We present a method for fine-grained identity tuning in text-to-image personalization models. Unlike standard image editing, which operates on a given image, identity tuning modifies the latent representation of a specific identity, enabling the generation of diverse images that consistently depict the same edited identity. To enable fine-grained latent identity tuning, we explore the latent space of a pre-trained, frozen encoder for text-to-image personalization. Our approach requires no additional training. Instead, it leverages the existing architecture of a frozen encoder to uncover latent semantic directions. This space consists of a set of latent tokens that play distinct roles in capturing different aspects of an identity and often correspond to specific spatial or semantic facial regions. We show that meaningful directions can be identified within this space and within subspaces defined by selected tokens, enabling localized, fine-grained, and semantically coherent edits. We validate our approach through qualitative and quantitative experiments that demonstrate diverse localized facial edits while preserving cross-image identity consistency. Project page at: https://garibida.github.io/IdentityTuning/