ChatPaper.aiChatPaper

Workspace-Bench 1.0: Avaliação de Agentes de IA em Tarefas de Espaço de Trabalho com Dependências de Arquivos em Larga Escala

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

May 5, 2026
Autores: Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Weizheng Wang, Hongzhang Huang, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu
cs.AI

Resumo

A aprendizagem em espaço de trabalho requer que agentes de IA identifiquem, raciocinem sobre, explorem e atualizem dependências explícitas e implícitas entre arquivos heterogêneos no espaço de trabalho de um profissional, permitindo-lhes concluir tarefas rotineiras e avançadas com eficácia. Apesar de sua importância, os benchmarks relevantes existentes avaliam principalmente agentes em arquivos pré-especificados ou sintetizados com dependências do mundo real limitadas, deixando a avaliação em nível de espaço de trabalho subexplorada. Para tanto, apresentamos o Workspace-Bench, um benchmark para avaliar agentes de IA na Aprendizagem em Espaço de Trabalho envolvendo Dependências de Arquivos em Larga Escala. Construímos espaços de trabalho realistas com 5 perfis de profissionais, 74 tipos de arquivo, 20.476 arquivos (até 20 GB) e curamos 388 tarefas, cada uma com seu próprio grafo de dependência de arquivos, avaliadas por 7.399 critérios no total que exigem recuperação cruzada de arquivos, raciocínio contextual e tomada de decisão adaptativa. Oferecemos ainda o Workspace-Bench-Lite, um subconjunto de 100 tarefas que preserva a distribuição do benchmark enquanto reduz os custos de avaliação em cerca de 70%. Avaliamos 4 plataformas de agentes populares e 7 modelos de base. Os resultados experimentais mostram que os agentes atuais ainda estão longe de uma aprendizagem em espaço de trabalho confiável, onde o melhor atinge apenas 68,7%, substancialmente abaixo do resultado humano de 80,7%, e o desempenho médio entre os agentes é de apenas 47,4%.
English
Workspace learning requires AI agents to identify, reason over, exploit, and update explicit and implicit dependencies among heterogeneous files in a worker's workspace, enabling them to complete both routine and advanced tasks effectively. Despite its importance, existing relevant benchmarks largely evaluate agents on pre-specified or synthesized files with limited real-world dependencies, leaving workspace-level evaluation underexplored. To this end, we introduce Workspace-Bench, a benchmark for evaluating AI agents on Workspace Learning invOlving Large-Scale File Dependencies. We construct realistic workspaces with 5 worker profiles, 74 file types, 20,476 files (up to 20GB) and curate 388 tasks, each with its own file dependency graph, evaluated across 7,399 total rubrics that require cross-file retrieval, contextual reasoning, and adaptive decision-making. We further provide Workspace-Bench-Lite, a 100-task subset that preserves the benchmark distribution while reducing evaluation costs by about 70%. We evaluate 4 popular agent harnesses and 7 foundation models. Experimental results show that current agents remain far from reliable workspace learning, where the best reaches only 68.7%, substantially below the human result of 80.7%, and the average performance across agents is only 47.4%.