Cobrindo o Espaço de Ação Humana para Uso em Computadores: Síntese de Dados e Benchmark
Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
May 12, 2026
Autores: Miaosen Zhang, Xiaohan Zhao, Zhihong Tan, Zhou Huoshen, Yijia Fan, Yifan Yang, Kai Qiu, Bei Liu, Justin Wagle, Chenzhong Yin, Mingxi Cheng, Ji Li, Qi Dai, Chong Luo, Xu Yang, Xin Geng, Baining Guo
cs.AI
Resumo
Agentes de uso de computador (CUAs) automatizam trabalhos em tela, como ilustrado pelo GPT-5.4 e Claude. No entanto, sua confiabilidade em interações complexas e de baixa frequência ainda é baixa, limitando a confiança do usuário. Nossa análise de casos de falha de modelos avançados sugere um padrão de cauda longa nas operações de GUI, em que uma fração relativamente pequena de interações complexas e diversas é responsável por uma parcela desproporcional das falhas de tarefa. Hipotetizamos que esse problema decorre, em grande parte, da escassez de dados para interações complexas. Para abordar essa questão, propomos um novo benchmark, CUActSpot, para avaliar as capacidades dos modelos em interações complexas em cinco modalidades: GUI, texto, tabela, tela e imagem natural, bem como uma variedade de ações (clique, arrastar, desenhar, etc.), abrangendo uma gama mais ampla de tipos de interação do que benchmarks anteriores centrados em cliques, que focam principalmente em widgets de GUI. Também projetamos um pipeline de síntese de dados baseado em renderizador: cenas são automaticamente geradas para cada modalidade, capturas de tela e coordenadas de elementos são registradas, e um LLM produz instruções e traços de ação correspondentes. Após treinamento nesse corpus, nosso Phi-Ground-Any-4B supera modelos de código aberto com menos de 32B parâmetros. Disponibilizaremos nosso benchmark, dados, código e modelos em https://github.com/microsoft/Phi-Ground.git.
English
Computer-use agents (CUAs) automate on-screen work, as illustrated by GPT-5.4 and Claude. Yet their reliability on complex, low-frequency interactions is still poor, limiting user trust. Our analysis of failure cases from advanced models suggests a long-tail pattern in GUI operations, where a relatively small fraction of complex and diverse interactions accounts for a disproportionate share of task failures. We hypothesize that this issue largely stems from the scarcity of data for complex interactions. To address this problem, we propose a new benchmark CUActSpot for evaluating models' capabilities on complex interactions across five modalities: GUI, text, table, canvas, and natural image, as well as a variety of actions (click, drag, draw, etc.), covering a broader range of interaction types than prior click-centric benchmarks that focus mainly on GUI widgets. We also design a renderer-based data-synthesis pipeline: scenes are automatically generated for each modality, screenshots and element coordinates are recorded, and an LLM produces matching instructions and action traces. After training on this corpus, our Phi-Ground-Any-4B outperforms open-source models with fewer than 32B parameters. We will release our benchmark, data, code, and models at https://github.com/microsoft/Phi-Ground.git