ChatPaper.aiChatPaper

SCOPE: Decomposição Estruturada e Orquestração Condicional de Habilidades para Geração de Imagens Complexas

SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

May 8, 2026
Autores: Tianfei Ren, Zhipeng Yan, Yiming Zhao, Zhen Fang, Yu Zeng, Guohui Zhang, Hang Xu, Xiaoxiao Ma, Shiting Huang, Ke Xu, Wenxuan Huang, Lionel Z. Wang, Lin Chen, Zehui Chen, Jie Huang, Feng Zhao
cs.AI

Resumo

Embora os modelos de texto para imagem tenham avançado significativamente em fidelidade visual, a realização fiel de intenções visuais complexas continua desafiadora, pois muitos requisitos precisam ser rastreados ao longo do embasamento, geração e verificação. Referimo-nos a esses requisitos como compromissos semânticos e formalizamos sua descontinuidade no ciclo de vida como a Ruptura Conceitual, onde os compromissos podem ser localmente resolvidos ou verificados, mas deixam de ser identificáveis como as mesmas unidades operacionais ao longo do ciclo de vida da geração. Para lidar com isso, propomos o SCOPE, um framework de orquestração de habilidades guiado por especificações que mantém compromissos semânticos em uma especificação estruturada em evolução e invoca condicionalmente habilidades de recuperação, raciocínio e reparo em torno de compromissos não resolvidos ou violados. Para avaliar a realização de intenções ao nível de compromissos, introduzimos o Gen-Arena, um benchmark anotado por humanos com especificações em nível de entidade e restrição, juntamente com a Taxa de Aprovação de Intenção com Portão de Entidade (EGIP), um critério rigoroso de aprovação com prioridade de entidade. O SCOPE supera substancialmente todas as bases de referência avaliadas no Gen-Arena, alcançando 0,60 de EGIP, e também obtém resultados fortes no WISE-V (0,907) e no MindBench (0,61), demonstrando a eficácia do rastreamento persistente de compromissos para geração de imagens complexas.
English
While text-to-image models have made strong progress in visual fidelity, faithfully realizing complex visual intents remains challenging because many requirements must be tracked across grounding, generation, and verification. We refer to these requirements as semantic commitments and formalize their lifecycle discontinuity as the Conceptual Rift, where commitments may be locally resolved or checked but fail to remain identifiable as the same operational units throughout the generation lifecycle. To address this, we propose SCOPE, a specification-guided skill orchestration framework that maintains semantic commitments in an evolving structured specification and conditionally invokes retrieval, reasoning, and repair skills around unresolved or violated commitments. To evaluate commitment-level intent realization, we introduce Gen-Arena, a human-annotated benchmark with entity- and constraint-level specifications, together with Entity-Gated Intent Pass Rate (EGIP), a strict entity-first pass criterion. SCOPE substantially outperforms all evaluated baselines on Gen-Arena, achieving 0.60 EGIP, and further achieves strong results on WISE-V (0.907) and MindBench (0.61), demonstrating the effectiveness of persistent commitment tracking for complex image generation.