InstanceControl: Geração Controlável de Imagens Complexas sem Rotulagem de Instâncias
InstanceControl: Controllable Complex Image Generation without Instance Labeling
June 30, 2026
Autores: Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo
cs.AI
Resumo
Métodos de geração de imagens controláveis, como o ControlNet, demonstraram uma capacidade notável de introduzir condições visuais (por exemplo, mapas de profundidade) para orientar a geração de imagens. No entanto, esses métodos frequentemente enfrentam dificuldades com cenas complexas de múltiplas instâncias, levando comumente a confusão de atributos entre as instâncias. Embora abordagens recentes tentem mitigar esse problema por meio da rotulagem manual de instâncias, tais requisitos demandam muito trabalho. Neste artigo, propomos o InstanceControl, um novo método de geração controlável de múltiplas instâncias que elimina a necessidade de rotulagem de instâncias. Identificamos que o principal gargalo nos métodos existentes é a incapacidade de associar com precisão as descrições das instâncias às suas regiões correspondentes dentro das condições visuais. Para resolver isso, utilizamos o Modelo Visão-Linguagem (VLM) para estabelecer correspondências em nível de instância entre prompts de texto e condições visuais. Especificamente, o VLM analisa automaticamente as descrições das instâncias a partir dos prompts de texto e, simultaneamente, prevê máscaras de instâncias com base nas condições visuais. Além disso, como as máscaras previstas podem conter ruído, introduzimos uma estratégia de refinamento adaptativo de máscaras que refina dinamicamente essas máscaras de instância durante o processo de geração. Experimentos extensos demonstram que nossa abordagem supera os métodos de ponta, alcançando fidelidade superior e controle preciso em nível de instância.
English
Controllable image generation methods, such as ControlNet, have demonstrated a remarkable capacity to introduce visual conditions(e.g., depth maps) to guide image generation. However, these methods often struggle with complex multi-instance scenes, frequently leading to attribute confusion among instances. While recent approaches attempt to mitigate this via manual instance labeling, such requirements are labor-intensive. In this paper, we propose InstanceControl, a novel multi-instance controllable generation method that eliminates the need for instance labeling. We identify the primary bottleneck in existing methods as the inability to accurately associate instance descriptions with their corresponding regions within visual conditions. To address this, we leverage the Vision-Language Model (VLM) to establish instance-level correspondences between text prompts and visual conditions. Specifically, the VLM automatically parses instance descriptions from the text prompts and simultaneously predicts instance masks based on the visual conditions. Furthermore, since the predicted masks may contain noise, we introduce an adaptive mask refinement strategy that dynamically refines these instance masks during the generation process. Extensive experiments demonstrate that our approach outperforms state-of-the-art methods, achieving superior fidelity and precise instance-level control.