CanvasAgent: Обеспечение создания и редактирования сложных изображений посредством оркестрации визуальных инструментов
CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration
July 6, 2026
Авторы: Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang
cs.AI
Аннотация
Сложное создание и редактирование изображений часто требует более одной модели генерации или редактирования. Запрос пользователя может включать синтез изображений, локализацию объектов, сегментацию областей, редактирование выбранного содержимого, компоновку промежуточных ресурсов, чтение текста и улучшение конечного результата. Такие задачи переводят мультимодальные агенты от рассуждений, дополненных восприятием, к визуальному творчеству, ориентированному на манипуляции, где инструменты должны активно преобразовывать визуальные состояния, а не просто проверять их. Однако существующие мультимодальные агенты, использующие инструменты, в основном оптимизированы для восприятия, поиска или предметно-ориентированного редактирования и не имеют крупномасштабного контроля для исполнимых траекторий создания изображений. В этой статье мы представляем CanvasCraft — крупномасштабный мультимодальный набор данных для использования инструментов при сложном создании и редактировании изображений, а также CanvasAgent — мультимодального агента с расширенными инструментами, который учится координировать разнородные визуальные инструменты посредством многораундового взаимодействия. CanvasCraft содержит 140 тысяч полностью аннотированных исполнимых траекторий и 10 тысяч спецификаций задач для обучения с подкреплением. CanvasAgent сначала обучается с помощью SFT для изучения исполнимых траекторий «рассуждение-действие», а затем оптимизируется с помощью GRPO с использованием гибридного вознаграждения, объединяющего сигналы на уровне результата и процесса. Во время развертывания CanvasAgent проверяет промежуточные результаты, отслеживает визуальные ресурсы и адаптирует решения по инструментам к изменяющемуся визуальному состоянию. Эксперименты оценивают как качество конечного изображения, так и поведение траектории, демонстрируя эффективность CanvasAgent и предложенного набора данных для сложных многокомпонентных рабочих процессов создания изображений.
English
Complex image creation and editing often require more than a single generation or editing model. A user request may involve synthesizing images, localizing objects, segmenting regions, editing selected content, compositing intermediate assets, reading text, and enhancing the final result. Such tasks shift multimodal agents from perception-augmented reasoning to manipulation-centered visual creation, where tools must actively transform visual states rather than merely inspect them. However, existing multimodal tool-use agents are mostly optimized for perception, search, or domain-specific editing, and lack large-scale supervision for executable image-creation trajectories. In this paper, we introduce CanvasCraft, a large-scale multimodal tool-use dataset for complex image creation and editing, and CanvasAgent, a tool-augmented multimodal agent that learns to orchestrate heterogeneous visual tools through multi-turn interaction. CanvasCraft contains 140K fully annotated executable trajectories and 10K
RL task specifications. CanvasAgent is first trained with SFT to learn executable reasoning-action trajectories, and is then optimized with GRPO using a hybrid reward that combines outcome- and process-level signals. During rollout, CanvasAgent inspects intermediate results, tracks visual assets, and adapts tool decisions to the evolving visual state. Experiments evaluate both final image quality and trajectory behavior, demonstrating the effectiveness of CanvasAgent and the proposed dataset for complex multi-tool image creation workflows.