IV-CoT: Cadeia de Pensamento Visual Implícita para Geração de Imagens Cientes da Estrutura a partir de Texto
IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation
June 23, 2026
Autores: Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun
cs.AI
Resumo
Modelos de linguagem grandes multimodais unificados (MLLMs) alcançaram forte qualidade na geração de texto para imagem, mas ainda enfrentam dificuldades no seguimento de prompt consciente de estrutura, onde contagens de objetos, relações espaciais, vinculações de atributos e layouts grosseiros devem ser preservados. Atribuímos essa limitação, em parte, ao entrelaçamento do planejamento estrutural e da renderização de aparência dentro de um único fluxo de condicionamento. Para abordar esse problema, propomos a Cadeia de Pensamento Visual Implícita (IV-CoT), uma estrutura de raciocínio visual latente para geração de imagem condicionada por consulta. A IV-CoT decompõe as consultas de condicionamento visual em uma cascata estrutural-semântica, na qual consultas estruturais primeiro formam um plano visual latente e, em seguida, consultas semânticas renderizam a aparência condicionada a esse plano. Para orientar as consultas estruturais, introduzimos supervisão de esboço apenas durante o treinamento, que as incentiva a capturar a estrutura a partir de esboços sem exigir extração de esboço ou decodificação intermediária na inferência. A IV-CoT realiza raciocínio CoT implícito em uma única passagem direta e alcança resultados superiores no GenEval e no T2I-CompBench. Visualizações e análises demonstram que as consultas estruturais e semânticas aprendidas desempenham papéis complementares na geração consciente de estrutura.
English
Unified multi-modal large language models (MLLMs) have achieved strong text-to-image generation quality, but still struggle with structure-aware prompt following, where object counts, spatial relations, attribute bindings, and coarse layouts must be preserved. We attribute this limitation in part to the entanglement of structural planning and appearance rendering within a single conditioning stream. To address this issue, we propose Implicit Visual Chain-of-Thought (IV-CoT), a latent visual reasoning framework for query-conditioned image generation. IV-CoT decomposes the visual conditioning queries into a structural-to-semantic cascade, where structural queries first form a latent visual plan and semantic queries then render appearance conditioned on this plan. To guide the structural queries, we introduce training-only sketch supervision, which encourages them to capture structure from sketches without requiring sketch extraction or intermediate decoding at inference time. IV-CoT performs implicit CoT reasoning in a single forward pass and achieves superior results on GenEval and T2I-CompBench. Visualizations and analyses demonstrate that the learned structural and semantic queries play complementary roles in structure-aware generation.