Het bestrijken van de menselijke actieruimte voor computergebruik: Datasynthese en benchmark
Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
May 12, 2026
Auteurs: Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong Yin, Mingxi Cheng, Ji Li, Qi Dai, Chong Luo, Xu Yang, Xin Geng, Baining Guo
cs.AI
Samenvatting
Computergebruik-agenten (CUA's) automatiseren werk op het scherm, zoals geïllustreerd door GPT-5.4 en Claude. Hun betrouwbaarheid bij complexe, laagfrequente interacties is echter nog steeds slecht, wat het vertrouwen van de gebruiker beperkt. Onze analyse van faalgevallen van geavanceerde modellen suggereert een 'long-tail'-patroon in GUI-operaties, waarbij een relatief klein aandeel van complexe en diverse interacties verantwoordelijk is voor een onevenredig groot deel van taakfouten. We veronderstellen dat dit probleem grotendeels voortkomt uit de schaarste aan gegevens voor complexe interacties. Om dit probleem aan te pakken, stellen we een nieuwe benchmark CUActSpot voor voor het evalueren van de mogelijkheden van modellen op complexe interacties in vijf modaliteiten: GUI, tekst, tabel, canvas en natuurlijke afbeelding, evenals een verscheidenheid aan acties (klikken, slepen, tekenen, enz.), die een breder scala aan interactietypen bestrijkt dan eerdere klikgecentreerde benchmarks die zich voornamelijk richten op GUI-widgets. We ontwerpen ook een op renderer gebaseerde datasynthesespijplijn: scènes worden automatisch gegenereerd voor elke modaliteit, schermafbeeldingen en elementcoördinaten worden geregistreerd, en een LLM produceert bijpassende instructies en actiesporen. Na training op dit corpus presteert onze Phi-Ground-Any-4B beter dan open-source modellen met minder dan 32B parameters. We zullen onze benchmark, gegevens, code en modellen vrijgeven op https://github.com/microsoft/Phi-Ground.git
English
Computer-use agents (CUAs) automate on-screen work, as illustrated by GPT-5.4 and Claude. Yet their reliability on complex, low-frequency interactions is still poor, limiting user trust. Our analysis of failure cases from advanced models suggests a long-tail pattern in GUI operations, where a relatively small fraction of complex and diverse interactions accounts for a disproportionate share of task failures. We hypothesize that this issue largely stems from the scarcity of data for complex interactions. To address this problem, we propose a new benchmark CUActSpot for evaluating models' capabilities on complex interactions across five modalities: GUI, text, table, canvas, and natural image, as well as a variety of actions (click, drag, draw, etc.), covering a broader range of interaction types than prior click-centric benchmarks that focus mainly on GUI widgets. We also design a renderer-based data-synthesis pipeline: scenes are automatically generated for each modality, screenshots and element coordinates are recorded, and an LLM produces matching instructions and action traces. After training on this corpus, our Phi-Ground-Any-4B outperforms open-source models with fewer than 32B parameters. We will release our benchmark, data, code, and models at https://github.com/microsoft/Phi-Ground.git