TUA-Bench: Een benchmark voor algemeen bruikbare terminal-agenten
TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents
June 26, 2026
Auteurs: Shoufa Chen, Luyuan Wang, Xuan Yang, Zhiheng Liu, Yuren Cong, Yuanfeng Ji, Feiyan Zhou, Xiaohui Zhang, Fanny Yang, Belinda Zeng
cs.AI
Samenvatting
Naarmate grote taalmodellen en raamwerken voor het inzetten ervan zich blijven ontwikkelen, zijn agenten die in terminals opereren steeds beter in staat om een breder scala aan algemene computergebruikstaken uit te voeren, verder dan alleen programmeren. Bestaande benchmarks evalueren echter niet adequaat algemene terminalgebaseerde computeragenten (TUA's): algemene computergebruik-benchmarks richten zich voornamelijk op grafische gebruikersinterfaces (GUI's), terwijl terminalgebaseerde benchmarks grotendeels de nadruk leggen op technische en programmeergerichte workflows die historisch gezien eigen zijn aan de shell. Wij introduceren TUA-Bench, een algemene benchmark voor terminalagenten. TUA-Bench omvat 120 praktijkgerichte taken verdeeld over vijf taakfamilies, die alledaagse digitale activiteiten beslaan – waaronder documentbewerking, e-mailbeheer en het zoeken van actuele informatie op het live-web – evenals wetenschappelijke en technische workflows, ontworpen samen met domeinexperts op PhD-niveau, die gespecialiseerde software vereisen. Deze breedte onderscheidt TUA-Bench van eerdere shell-gebonden of domeinspecifieke benchmarks. Elke taak is handmatig ontworpen, wordt uitgevoerd in een echte terminal met een deterministisch installatiescript en wordt geëvalueerd met een op uitvoering gebaseerd scoringsprotocol. Wij constateren dat de sterkste grensverleggende agent, Claude Code met Claude Opus 4.8 maximale redeneerinspanning, een algehele prestatie van 65,8% behaalt, met aanzienlijke hiaten in beide sporen. Door een brede en realistische evaluatie van terminalgebruiksmogelijkheden te bieden, streeft TUA-Bench ernaar de overgang te versnellen van smalle, taakspecifieke assistenten naar algemene agenten die betrouwbaar kunnen opereren in uiteenlopende digitale omgevingen.
English
As large language models and harness frameworks continue to advance, agents operating in terminals are increasingly capable of performing a broader range of general computer-use tasks beyond coding. However, existing benchmarks do not adequately evaluate general-purpose terminal computer-use agents (TUAs): general computer-use benchmarks primarily target graphical user interfaces (GUIs), whereas terminal-based benchmarks largely emphasize technical and programming-centric workflows historically native to the shell. We introduce TUA-Bench, a general-purpose benchmark for terminal-use agents. TUA-Bench includes 120 real-world tasks across five task families, covering routine digital activities-including document editing, email management, and live-web information seeking-as well as scientific and engineering workflows co-designed with PhD-level domain experts that require specialized software. This breadth distinguishes TUA-Bench from prior shell-focused or domain-specific benchmarks. Each task is manually designed, runs in a real terminal with a deterministic setup script, and is evaluated by an execution-based scoring protocol. We find that the strongest frontier agent, Claude Code with Claude Opus 4.8 max reasoning effort, achieves 65.8% overall performance, with substantial gaps across both tracks. By providing a broad and realistic evaluation of terminal-use capabilities, TUA-Bench aims to accelerate the transition from narrow, task-specific assistants to general-purpose agents capable of operating reliably across diverse digital environments.