ChatPaper.aiChatPaper

CanvasAgent: Het mogelijk maken van complexe beeldcreatie en -bewerking via visuele toolorkestratie

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

July 6, 2026
Auteurs: Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang
cs.AI

Samenvatting

Complex beeldcreatie en -bewerking vereisen vaak meer dan één enkel generatie- of bewerkingsmodel. Een gebruikersverzoek kan het synthetiseren van afbeeldingen, lokaliseren van objecten, segmenteren van regio's, bewerken van geselecteerde inhoud, samenstellen van tussenliggende assets, lezen van tekst en verbeteren van het eindresultaat omvatten. Dergelijke taken verschuiven multimodale agenten van perceptie-verbeterde redenering naar manipulatiegerichte visuele creatie, waarbij tools actief visuele toestanden moeten transformeren in plaats van ze alleen te inspecteren. Bestaande multimodale agenten voor toolgebruik zijn echter meestal geoptimaliseerd voor perceptie, zoekopdrachten of domeinspecifieke bewerking, en missen grootschalige supervisie voor uitvoerbare beeldcreatietrajecten. In dit artikel introduceren we CanvasCraft, een grootschalige multimodale dataset voor toolgebruik voor complexe beeldcreatie en -bewerking, en CanvasAgent, een met tools verrijkte multimodale agent die leert om heterogene visuele tools te orkestreren via multi-turn interactie. CanvasCraft bevat 140K volledig geannoteerde uitvoerbare trajecten en 10K RL-taakspecificaties. CanvasAgent wordt eerst getraind met SFT om uitvoerbare redenerings-actietrajecten te leren, en vervolgens geoptimaliseerd met GRPO met behulp van een hybride beloning die zowel uitkomst- als procesniveausignalen combineert. Tijdens de uitrol inspecteert CanvasAgent tussenresultaten, volgt het visuele assets en past het toolbeslissingen aan op de evoluerende visuele toestand. Experimenten evalueren zowel de uiteindelijke beeldkwaliteit als het trajectgedrag, wat de effectiviteit van CanvasAgent en de voorgestelde dataset voor complexe multi-tool beeldcreatieworkflows aantoont.
English
Complex image creation and editing often require more than a single generation or editing model. A user request may involve synthesizing images, localizing objects, segmenting regions, editing selected content, compositing intermediate assets, reading text, and enhancing the final result. Such tasks shift multimodal agents from perception-augmented reasoning to manipulation-centered visual creation, where tools must actively transform visual states rather than merely inspect them. However, existing multimodal tool-use agents are mostly optimized for perception, search, or domain-specific editing, and lack large-scale supervision for executable image-creation trajectories. In this paper, we introduce CanvasCraft, a large-scale multimodal tool-use dataset for complex image creation and editing, and CanvasAgent, a tool-augmented multimodal agent that learns to orchestrate heterogeneous visual tools through multi-turn interaction. CanvasCraft contains 140K fully annotated executable trajectories and 10K RL task specifications. CanvasAgent is first trained with SFT to learn executable reasoning-action trajectories, and is then optimized with GRPO using a hybrid reward that combines outcome- and process-level signals. During rollout, CanvasAgent inspects intermediate results, tracks visual assets, and adapts tool decisions to the evolving visual state. Experiments evaluate both final image quality and trajectory behavior, demonstrating the effectiveness of CanvasAgent and the proposed dataset for complex multi-tool image creation workflows.