CanvasAgent : Permettant la création et l'édition d'images complexes via l'orchestration d'outils visuels
CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration
July 6, 2026
Auteurs: Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang
cs.AI
Résumé
La création et l'édition complexes d'images nécessitent souvent plus qu'un simple modèle de génération ou d'édition unique. Une requête utilisateur peut impliquer la synthèse d'images, la localisation d'objets, la segmentation de régions, l'édition de contenu sélectionné, la composition d'actifs intermédiaires, la lecture de texte et l'amélioration du résultat final. De telles tâches font passer les agents multimodaux d'un raisonnement augmenté par la perception à une création visuelle centrée sur la manipulation, où les outils doivent transformer activement les états visuels plutôt que de simplement les inspecter. Cependant, les agents multimodaux existants utilisant des outils sont principalement optimisés pour la perception, la recherche ou l'édition spécifique à un domaine, et manquent de supervision à grande échelle pour les trajectoires exécutables de création d'images. Dans cet article, nous présentons CanvasCraft, un jeu de données multimodal à grande échelle pour la création et l'édition complexes d'images, et CanvasAgent, un agent multimodal augmenté d'outils qui apprend à orchestrer des outils visuels hétérogènes via une interaction multi-tours. CanvasCraft contient 140 000 trajectoires exécutables entièrement annotées et 10 000 spécifications de tâches RL. CanvasAgent est d'abord entraîné avec SFT pour apprendre des trajectoires raisonnement-action exécutables, puis optimisé avec GRPO en utilisant une récompense hybride combinant des signaux au niveau du résultat et du processus. Pendant le déploiement, CanvasAgent inspecte les résultats intermédiaires, suit les actifs visuels et adapte les décisions d'outils à l'état visuel en évolution. Les expériences évaluent à la fois la qualité finale de l'image et le comportement de la trajectoire, démontrant l'efficacité de CanvasAgent et du jeu de données proposé pour les workflows complexes de création d'images multi-outils.
English
Complex image creation and editing often require more than a single generation or editing model. A user request may involve synthesizing images, localizing objects, segmenting regions, editing selected content, compositing intermediate assets, reading text, and enhancing the final result. Such tasks shift multimodal agents from perception-augmented reasoning to manipulation-centered visual creation, where tools must actively transform visual states rather than merely inspect them. However, existing multimodal tool-use agents are mostly optimized for perception, search, or domain-specific editing, and lack large-scale supervision for executable image-creation trajectories. In this paper, we introduce CanvasCraft, a large-scale multimodal tool-use dataset for complex image creation and editing, and CanvasAgent, a tool-augmented multimodal agent that learns to orchestrate heterogeneous visual tools through multi-turn interaction. CanvasCraft contains 140K fully annotated executable trajectories and 10K
RL task specifications. CanvasAgent is first trained with SFT to learn executable reasoning-action trajectories, and is then optimized with GRPO using a hybrid reward that combines outcome- and process-level signals. During rollout, CanvasAgent inspects intermediate results, tracks visual assets, and adapts tool decisions to the evolving visual state. Experiments evaluate both final image quality and trajectory behavior, demonstrating the effectiveness of CanvasAgent and the proposed dataset for complex multi-tool image creation workflows.