ChatPaper.aiChatPaper

GUICrafter: Agente GUI fracamente supervisionado utilizando capturas de tela não anotadas em massa

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

June 29, 2026
Autores: Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu
cs.AI

Resumo

Os dados, como substrato fundamental da inteligência moderna, impulsionaram significativamente o desenvolvimento dos atuais modelos de base. Naturalmente, os pesquisadores buscam estender esse paradigma ao domínio dos agentes de GUI, na esperança de construir agentes de GUI robustos por meio de um paradigma semelhante. No entanto, os dados de agentes de GUI não podem ser coletados diretamente da internet, tornando seu custo elevado e difícil de obter em escala. Como resultado, os atuais agentes de GUI sofrem de baixa generalização entre dispositivos e capacidade limitada de ancoragem visual para elementos granulares de GUI. Como uma tentativa de enfrentar o desafio de dados em agentes de GUI, propomos o GUICrafter, um agente de GUI fracamente supervisionado que utiliza capturas de tela não anotadas em larga escala para reduzir substancialmente a dependência de anotações humanas caras. O GUICrafter explora uma estrutura de aprendizado curricular para treinar agentes de GUI por meio de duas etapas progressivas. Primeiro, o modelo aprende ancoragem visual a partir de capturas de tela e páginas da web não anotadas em grande escala, aproveitando os ricos sinais contextuais inerentes às interações de GUI sem anotações humanas. Em seguida, na Etapa 2, utilizamos uma pequena quantidade de dados de alta qualidade para calibrar o modelo por meio de aprendizado por reforço. Experimentos mostram que o GUICrafter alcança desempenho competitivo, ou até superior, a sistemas avançados como UI-TARS, utilizando apenas 0,1% de seus dados. Além disso, sob a mesma quantidade de dados anotados, o GUICrafter supera todos os métodos anteriores, como GUI-R1. Código, dados e modelos estão disponíveis em https://github.com/fansunqi/GUICrafter.
English
Data, as the fundamental substrate of modern intelligence, has greatly driven the development of current foundation models. Naturally, researchers aim to extend this paradigm to the domain of GUI agents, hoping to build strong GUI agents through a similar paradigm. However, GUI agent data cannot be directly harvested from the internet, making it costly and difficult to collect at scale. As a result, current GUI agents suffer from poor cross-device generalization and limited visual grounding ability for fine-grained GUI elements. As an attempt to address data challenge in GUI agents, we propose GUICrafter, a weakly-supervised GUI agent leveraging massive unannotated screenshots to substantially reduce the reliance on expensive human annotations. GUICrafter explores a curriculum learning framework for training GUI agents through two progressive stages. First, the model learns visual grounding from large-scale unannotated screenshots and webpages, leveraging the rich contextual signals inherent in GUI interactions without human annotations. Then, in Stage 2, we leverage a small amount of high-quality data to calibrate the model via reinforcement learning. Experiments show that GUICrafter achieves competitive, or even superior, performance to advanced systems like UI-TARS while using only 0.1% of its data. Furthermore, under the same amount of annotated data, GUICrafter surpasses all previous methods such as GUI-R1. Code, data, and models are available at https://github.com/fansunqi/GUICrafter.