TUA-Bench: Um Benchmark para Agentes de Propósito Geral para Uso em Terminal
TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
June 26, 2026
Autores: Shoufa Chen, Luyuan Wang, Xuan Yang, Zhiheng Liu, Yuren Cong, Yuanfeng Ji, Feiyan Zhou, Xiaohui Zhang, Fanny Yang, Belinda Zeng
cs.AI
Resumo
À medida que os modelos de linguagem de grande escala e os frameworks de suporte continuam a avançar, os agentes que operam em terminais estão cada vez mais capacitados para realizar uma gama mais ampla de tarefas gerais de uso de computador, além da codificação. No entanto, os benchmarks existentes não avaliam adequadamente agentes de uso de terminal para propósito geral (TUAs): benchmarks de uso geral de computador focam principalmente em interfaces gráficas de usuário (GUIs), enquanto benchmarks baseados em terminal enfatizam amplamente fluxos de trabalho técnicos e centrados em programação, historicamente nativos do shell. Apresentamos o TUA-Bench, um benchmark de propósito geral para agentes de terminal. O TUA-Bench inclui 120 tarefas do mundo real distribuídas em cinco famílias de tarefas, abrangendo atividades digitais rotineiras — incluindo edição de documentos, gerenciamento de e-mail e busca de informações na web em tempo real — bem como fluxos de trabalho científicos e de engenharia, co-projetados com especialistas de domínio em nível de doutorado, que exigem software especializado. Essa amplitude distingue o TUA-Bench de benchmarks anteriores focados em shell ou específicos de domínio. Cada tarefa é projetada manualmente, executada em um terminal real com um script de configuração determinístico e avaliada por um protocolo de pontuação baseado em execução. Constatamos que o agente de fronteira mais forte, Claude Code com Claude Opus 4.8 com esforço de raciocínio máximo, alcança 65,8% de desempenho geral, com lacunas substanciais em ambas as categorias. Ao fornecer uma avaliação ampla e realista das capacidades de uso de terminal, o TUA-Bench visa acelerar a transição de assistentes restritos e específicos para tarefas para agentes de propósito geral capazes de operar de forma confiável em diversos ambientes digitais.
English
As large language models and harness frameworks continue to advance, agents operating in terminals are increasingly capable of performing a broader range of general computer-use tasks beyond coding. However, existing benchmarks do not adequately evaluate general-purpose terminal computer-use agents (TUAs): general computer-use benchmarks primarily target graphical user interfaces (GUIs), whereas terminal-based benchmarks largely emphasize technical and programming-centric workflows historically native to the shell. We introduce TUA-Bench, a general-purpose benchmark for terminal-use agents. TUA-Bench includes 120 real-world tasks across five task families, covering routine digital activities-including document editing, email management, and live-web information seeking-as well as scientific and engineering workflows co-designed with PhD-level domain experts that require specialized software. This breadth distinguishes TUA-Bench from prior shell-focused or domain-specific benchmarks. Each task is manually designed, runs in a real terminal with a deterministic setup script, and is evaluated by an execution-based scoring protocol. We find that the strongest frontier agent, Claude Code with Claude Opus 4.8 max reasoning effort, achieves 65.8% overall performance, with substantial gaps across both tracks. By providing a broad and realistic evaluation of terminal-use capabilities, TUA-Bench aims to accelerate the transition from narrow, task-specific assistants to general-purpose agents capable of operating reliably across diverse digital environments.