ChatPaper.aiChatPaper

CanvasAgent: Posibilitando la creación y edición de imágenes complejas mediante la orquestación de herramientas visuales

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

July 6, 2026
Autores: Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang
cs.AI

Resumen

La creación y edición de imágenes complejas suele requerir más que un único modelo de generación o edición. Una solicitud de usuario puede implicar sintetizar imágenes, localizar objetos, segmentar regiones, editar contenido seleccionado, componer activos intermedios, leer texto y mejorar el resultado final. Dichas tareas transforman a los agentes multimodales de un razonamiento aumentado por percepción hacia una creación visual centrada en la manipulación, donde las herramientas deben transformar activamente los estados visuales en lugar de simplemente inspeccionarlos. Sin embargo, los agentes multimodales existentes para el uso de herramientas están mayormente optimizados para percepción, búsqueda o edición específica de dominio, y carecen de supervisión a gran escala para trayectorias ejecutables de creación de imágenes. En este artículo, presentamos CanvasCraft, un conjunto de datos multimodales a gran escala para el uso de herramientas en creación y edición de imágenes complejas, y CanvasAgent, un agente multimodal aumentado con herramientas que aprende a orquestar herramientas visuales heterogéneas mediante interacción en múltiples turnos. CanvasCraft contiene 140.000 trayectorias ejecutables completamente anotadas y 10.000 especificaciones de tareas de refuerzo (RL). CanvasAgent se entrena primero con SFT para aprender trayectorias de razonamiento-acción ejecutables, y luego se optimiza con GRPO utilizando una recompensa híbrida que combina señales a nivel de resultado y a nivel de proceso. Durante el despliegue, CanvasAgent inspecciona resultados intermedios, rastrea activos visuales y adapta las decisiones sobre las herramientas al estado visual en evolución. Los experimentos evalúan tanto la calidad final de la imagen como el comportamiento de la trayectoria, demostrando la efectividad de CanvasAgent y del conjunto de datos propuesto para flujos de trabajo complejos de creación de imágenes con múltiples herramientas.
English
Complex image creation and editing often require more than a single generation or editing model. A user request may involve synthesizing images, localizing objects, segmenting regions, editing selected content, compositing intermediate assets, reading text, and enhancing the final result. Such tasks shift multimodal agents from perception-augmented reasoning to manipulation-centered visual creation, where tools must actively transform visual states rather than merely inspect them. However, existing multimodal tool-use agents are mostly optimized for perception, search, or domain-specific editing, and lack large-scale supervision for executable image-creation trajectories. In this paper, we introduce CanvasCraft, a large-scale multimodal tool-use dataset for complex image creation and editing, and CanvasAgent, a tool-augmented multimodal agent that learns to orchestrate heterogeneous visual tools through multi-turn interaction. CanvasCraft contains 140K fully annotated executable trajectories and 10K RL task specifications. CanvasAgent is first trained with SFT to learn executable reasoning-action trajectories, and is then optimized with GRPO using a hybrid reward that combines outcome- and process-level signals. During rollout, CanvasAgent inspects intermediate results, tracks visual assets, and adapts tool decisions to the evolving visual state. Experiments evaluate both final image quality and trajectory behavior, demonstrating the effectiveness of CanvasAgent and the proposed dataset for complex multi-tool image creation workflows.