StableI2I: Detecção de Alterações Involuntárias na Transição de Imagem para Imagem
StableI2I: Spotting Unintended Changes in Image-to-Image Transition
May 6, 2026
Autores: Jiayang Li, Shuo Cao, Xiaohui Li, Zhizhen Zhang, Kaiwen Zhu, Yule Duan, Yu Qiao, Jian Zhang, Yihao Liu
cs.AI
Resumo
Na maioria dos cenários reais de imagem para imagem (I2I), as avaliações existentes concentram-se principalmente no seguimento de instruções e na qualidade perceptual ou estética das imagens geradas. No entanto, elas falham amplamente em avaliar se a imagem de saída preserva a correspondência semântica e a estrutura espacial da imagem de entrada. Para superar esta limitação, propomos o StableI2I, uma estrutura de avaliação unificada e dinâmica que mede explicitamente a fidelidade de conteúdo e a consistência pré e pós-processamento em uma ampla gama de tarefas I2I sem exigir imagens de referência, incluindo edição e restauração de imagens. Além disso, construímos o StableI2I-Bench, um benchmark projetado para avaliar sistematicamente a precisão de MLLMs nessas tarefas de avaliação de fidelidade e consistência. Resultados experimentais extensivos demonstram que o StableI2I fornece avaliações precisas, granulares e interpretáveis de fidelidade de conteúdo e consistência, com fortes correlações com julgamentos subjetivos humanos. Nossa estrutura serve como uma ferramenta de avaliação prática e confiável para diagnosticar a consistência de conteúdo e comparar o desempenho de modelos em sistemas I2I do mundo real.
English
In most real-world image-to-image (I2I) scenarios, existing evaluations primarily focus on instruction following and the perceptual quality or aesthetics of the generated images. However, they largely fail to assess whether the output image preserves the semantic correspondence and spatial structure of the input image. To address this limitation, we propose StableI2I, a unified and dynamic evaluation framework that explicitly measures content fidelity and pre--post consistency across a wide range of I2I tasks without requiring reference images, including image editing and image restoration. In addition, we construct StableI2I-Bench, a benchmark designed to systematically evaluate the accuracy of MLLMs on such fidelity and consistency assessment tasks. Extensive experimental results demonstrate that StableI2I provides accurate, fine-grained, and interpretable evaluations of content fidelity and consistency, with strong correlations to human subjective judgments. Our framework serves as a practical and reliable evaluation tool for diagnosing content consistency and benchmarking model performance in real-world I2I systems.