GUICrafter: een zwak gesuperviseerde GUI-agent die gebruikmaakt van massale niet-geannoteerde schermafbeeldingen
GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots
June 29, 2026
Auteurs: Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu
cs.AI
Samenvatting
Data, als het fundamentele substraat van moderne intelligentie, heeft de ontwikkeling van de huidige fundamentmodellen sterk gestimuleerd. Natuurlijk streven onderzoekers ernaar om dit paradigma uit te breiden naar het domein van GUI-agents, in de hoop via een vergelijkbaar paradigma sterke GUI-agents te bouwen. GUI-agentdata kan echter niet rechtstreeks van het internet worden geoogst, wat het kostbaar en moeilijk maakt om op grote schaal te verzamelen. Als gevolg hiervan hebben huidige GUI-agents te kampen met een slechte cross-device generalisatie en een beperkt visueel verankeringsvermogen voor fijnmazige GUI-elementen. Als een poging om de dataproblematiek bij GUI-agents aan te pakken, stellen we GUICrafter voor, een zwakgesuperviseerde GUI-agent die gebruikmaakt van enorme hoeveelheden niet-geannoteerde screenshots om de afhankelijkheid van dure menselijke annotaties aanzienlijk te verminderen. GUICrafter onderzoekt een raamwerk voor curriculumleren om GUI-agents te trainen via twee progressieve fasen. In de eerste fase leert het model visuele verankering van grootschalige niet-geannoteerde screenshots en webpagina's, waarbij het gebruikmaakt van de rijke contextuele signalen die inherent zijn aan GUI-interacties zonder menselijke annotaties. In fase 2 gebruiken we vervolgens een kleine hoeveelheid hoogwaardige data om het model te kalibreren via reinforcement learning. Experimenten tonen aan dat GUICrafter concurrerende of zelfs superieure prestaties levert ten opzichte van geavanceerde systemen zoals UI-TARS, terwijl het slechts 0,1% van de data gebruikt. Bovendien overtreft GUICrafter, onder dezelfde hoeveelheid geannoteerde data, alle eerdere methoden zoals GUI-R1. Code, data en modellen zijn beschikbaar op https://github.com/fansunqi/GUICrafter.
English
Data, as the fundamental substrate of modern intelligence, has greatly driven the development of current foundation models. Naturally, researchers aim to extend this paradigm to the domain of GUI agents, hoping to build strong GUI agents through a similar paradigm. However, GUI agent data cannot be directly harvested from the internet, making it costly and difficult to collect at scale. As a result, current GUI agents suffer from poor cross-device generalization and limited visual grounding ability for fine-grained GUI elements. As an attempt to address data challenge in GUI agents, we propose GUICrafter, a weakly-supervised GUI agent leveraging massive unannotated screenshots to substantially reduce the reliance on expensive human annotations. GUICrafter explores a curriculum learning framework for training GUI agents through two progressive stages. First, the model learns visual grounding from large-scale unannotated screenshots and webpages, leveraging the rich contextual signals inherent in GUI interactions without human annotations. Then, in Stage 2, we leverage a small amount of high-quality data to calibrate the model via reinforcement learning. Experiments show that GUICrafter achieves competitive, or even superior, performance to advanced systems like UI-TARS while using only 0.1% of its data. Furthermore, under the same amount of annotated data, GUICrafter surpasses all previous methods such as GUI-R1. Code, data, and models are available at https://github.com/fansunqi/GUICrafter.