Delta-Adapter: Edição de Imagens Escalável Baseada em Exemplares com Supervisão de Par Único
Delta-Adapter: Scalable Exemplar-Based Image Editing with Single-Pair Supervision
May 8, 2026
Autores: Jiacheng Chen, Songze Li, Han Fu, Baoquan Zhao, Wei Liu, Yanyan Liang, Li Qing, Xudong Mao
cs.AI
Resumo
Edição de imagens baseada em exemplares aplica uma transformação definida por um par de imagens fonte-alvo a uma nova imagem de consulta. Métodos existentes dependem de um paradigma de supervisão de pares de pares, exigindo dois pares de imagens que compartilhem a mesma semântica de edição para aprender a transformação alvo. Essa restrição torna difícil a curadoria de dados de treinamento em escala e limita a generalização para diversos tipos de edição. Propomos o Delta-Adapter, um método que aprende semânticas de edição transferíveis sob supervisão de par único, sem necessidade de orientação textual. Em vez de expor diretamente o par de exemplares ao modelo, utilizamos um codificador visual pré-treinado para extrair um delta semântico que codifica a transformação visual entre as duas imagens. Esse delta semântico é injetado em um modelo de edição de imagens pré-treinado por meio de um adaptador baseado em Perceiver. Como a imagem alvo nunca é diretamente visível para o modelo, ela pode servir como alvo de predição, possibilitando supervisão de par único sem exigir pares de exemplares adicionais. Essa formulação permite aproveitar conjuntos de dados de edição em grande escala existentes para treinamento. Para promover ainda mais uma transferência fiel da transformação, introduzimos uma perda de consistência do delta semântico que alinha a mudança semântica da saída gerada com o delta semântico de referência extraído do par de exemplares. Experimentos extensos demonstram que o Delta-Adapter melhora consistentemente tanto a precisão da edição quanto a consistência de conteúdo em relação a quatro linhas de base fortes em tarefas de edição já vistas, além de generalizar de forma mais eficaz para tarefas de edição não vistas. O código estará disponível em https://delta-adapter.github.io.
English
Exemplar-based image editing applies a transformation defined by a source-target image pair to a new query image. Existing methods rely on a pair-of-pairs supervision paradigm, requiring two image pairs sharing the same edit semantics to learn the target transformation. This constraint makes training data difficult to curate at scale and limits generalization across diverse edit types. We propose Delta-Adapter, a method that learns transferable editing semantics under single-pair supervision, requiring no textual guidance. Rather than directly exposing the exemplar pair to the model, we leverage a pre-trained vision encoder to extract a semantic delta that encodes the visual transformation between the two images. This semantic delta is injected into a pre-trained image editing model via a Perceiver-based adapter. Since the target image is never directly visible to the model, it can serve as the prediction target, enabling single-pair supervision without requiring additional exemplar pairs. This formulation allows us to leverage existing large-scale editing datasets for training. To further promote faithful transformation transfer, we introduce a semantic delta consistency loss that aligns the semantic change of the generated output with the ground-truth semantic delta extracted from the exemplar pair. Extensive experiments demonstrate that Delta-Adapter consistently improves both editing accuracy and content consistency over four strong baselines on seen editing tasks, while also generalizing more effectively to unseen editing tasks. Code will be available at https://delta-adapter.github.io.