ChatPaper.aiChatPaper

Ajuste de Identidad Latente en Modelos de Personalización de Texto a Imagen

Latent-Identity Tuning in Text-to-Image Personalization Models

July 13, 2026
Autores: Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik
cs.AI

Resumen

Generar y editar el rostro de una persona exige alta precisión, ya que incluso modificaciones menores pueden alterar significativamente la identidad percibida del sujeto. Sin embargo, los métodos actuales de personalización y edición basados en modelos generalistas de texto a imagen carecen a menudo de la precisión necesaria para realizar ediciones faciales detalladas. Presentamos un método de ajuste de identidad a nivel fino en modelos de personalización de texto a imagen. A diferencia de la edición de imágenes estándar, que opera sobre una imagen dada, el ajuste de identidad modifica la representación latente de una identidad específica, permitiendo generar imágenes diversas que representan de manera consistente la misma identidad editada. Para posibilitar un ajuste latente de identidad a nivel fino, exploramos el espacio latente de un codificador preentrenado y congelado para la personalización de texto a imagen. Nuestro enfoque no requiere entrenamiento adicional. En su lugar, aprovecha la arquitectura existente de un codificador congelado para descubrir direcciones semánticas latentes. Este espacio consiste en un conjunto de tokens latentes que desempeñan funciones distintas en la captura de diferentes aspectos de una identidad y a menudo corresponden a regiones faciales espaciales o semánticas específicas. Demostramos que se pueden identificar direcciones significativas dentro de este espacio y dentro de subespacios definidos por tokens seleccionados, lo que permite ediciones localizadas, a nivel fino y semánticamente coherentes. Validamos nuestro enfoque mediante experimentos cualitativos y cuantitativos que muestran ediciones faciales localizadas diversas, preservando al mismo tiempo la consistencia de identidad entre imágenes. Página del proyecto en: https://garibida.github.io/IdentityTuning/
English
Generating and editing a person's face demands high precision, as even minor modifications can significantly alter a subject's perceived identity. Current personalization and editing methods built on general-purpose text-to-image models, however, often lack the precision required for fine-grained facial edits. We present a method for fine-grained identity tuning in text-to-image personalization models. Unlike standard image editing, which operates on a given image, identity tuning modifies the latent representation of a specific identity, enabling the generation of diverse images that consistently depict the same edited identity. To enable fine-grained latent identity tuning, we explore the latent space of a pre-trained, frozen encoder for text-to-image personalization. Our approach requires no additional training. Instead, it leverages the existing architecture of a frozen encoder to uncover latent semantic directions. This space consists of a set of latent tokens that play distinct roles in capturing different aspects of an identity and often correspond to specific spatial or semantic facial regions. We show that meaningful directions can be identified within this space and within subspaces defined by selected tokens, enabling localized, fine-grained, and semantically coherent edits. We validate our approach through qualitative and quantitative experiments that demonstrate diverse localized facial edits while preserving cross-image identity consistency. Project page at: https://garibida.github.io/IdentityTuning/