ChatPaper.aiChatPaper

CanvasAgent: Permitindo a Criação e Edição de Imagens Complexas por Meio da Orquestração de Ferramentas Visuais

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

July 6, 2026
Autores: Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang
cs.AI

Resumo

A criação e edição complexa de imagens frequentemente exigem mais do que um único modelo de geração ou edição. Uma solicitação do usuário pode envolver sintetizar imagens, localizar objetos, segmentar regiões, editar conteúdo selecionado, compor ativos intermediários, ler texto e aprimorar o resultado final. Tais tarefas deslocam os agentes multimodais do raciocínio aumentado por percepção para a criação visual centrada em manipulação, onde as ferramentas devem transformar ativamente os estados visuais, em vez de apenas inspecioná-los. No entanto, os agentes multimodais existentes para uso de ferramentas são majoritariamente otimizados para percepção, busca ou edição específica de domínio, e carecem de supervisão em larga escala para trajetórias executáveis de criação de imagens. Neste artigo, apresentamos o CanvasCraft, um conjunto de dados multimodal em larga escala para uso de ferramentas em criação e edição complexa de imagens, e o CanvasAgent, um agente multimodal aumentado por ferramentas que aprende a orquestrar ferramentas visuais heterogêneas por meio de interação em múltiplas rodadas. O CanvasCraft contém 140 mil trajetórias executáveis totalmente anotadas e 10 mil especificações de tarefas de RL. O CanvasAgent é primeiro treinado com SFT para aprender trajetórias executáveis de raciocínio-ação, e depois otimizado com GRPO usando uma recompensa híbrida que combina sinais de resultado e de processo. Durante a rolagem (rollout), o CanvasAgent inspeciona resultados intermediários, rastreia ativos visuais e adapta as decisões de ferramentas ao estado visual em evolução. Os experimentos avaliam tanto a qualidade final da imagem quanto o comportamento da trajetória, demonstrando a eficácia do CanvasAgent e do conjunto de dados proposto para fluxos de trabalho complexos de criação de imagens com múltiplas ferramentas.
English
Complex image creation and editing often require more than a single generation or editing model. A user request may involve synthesizing images, localizing objects, segmenting regions, editing selected content, compositing intermediate assets, reading text, and enhancing the final result. Such tasks shift multimodal agents from perception-augmented reasoning to manipulation-centered visual creation, where tools must actively transform visual states rather than merely inspect them. However, existing multimodal tool-use agents are mostly optimized for perception, search, or domain-specific editing, and lack large-scale supervision for executable image-creation trajectories. In this paper, we introduce CanvasCraft, a large-scale multimodal tool-use dataset for complex image creation and editing, and CanvasAgent, a tool-augmented multimodal agent that learns to orchestrate heterogeneous visual tools through multi-turn interaction. CanvasCraft contains 140K fully annotated executable trajectories and 10K RL task specifications. CanvasAgent is first trained with SFT to learn executable reasoning-action trajectories, and is then optimized with GRPO using a hybrid reward that combines outcome- and process-level signals. During rollout, CanvasAgent inspects intermediate results, tracks visual assets, and adapts tool decisions to the evolving visual state. Experiments evaluate both final image quality and trajectory behavior, demonstrating the effectiveness of CanvasAgent and the proposed dataset for complex multi-tool image creation workflows.