UniClawBench: een universele benchmark voor proactieve agenten bij real-world taken
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
July 9, 2026
Auteurs: Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu
cs.AI
Samenvatting
De snelle ontwikkeling van grote taalmodellen en multimodale grote taalmodellen heeft de opkomst versneld van proactieve agenten die in staat zijn alledaagse hulpmiddelen te bedienen en gebruikers te ondersteunen in reële omgevingen. Bestaande benchmarks slagen er echter vaak niet in dergelijke agenten effectief te evalueren, omdat ze veelal gebruikmaken van sandbox-omgevingen en evaluatieparadigma's met één beurt. Bovendien vermengen hun scenario-gebaseerde taaktaxonomieën meerdere modelcapaciteiten binnen dezelfde taakcategorie, waardoor het moeilijk wordt de grondoorzaken van agentfouten te identificeren. Om deze beperkingen aan te pakken introduceren we UniClawBench, de eerste capaciteitsgestuurde benchmark die ontworpen is om proactieve agenten te evalueren in dynamische, reële omgevingen. UniClawBench is opgebouwd rond vijf fundamentele modelcapaciteiten: Vaardigheidsgebruik, Verkenning, Redeneren met Lange Context, Multimodaal Begrip en Cross-Platform Coördinatie. Op basis van deze capaciteiten ontwerpen we 400 tweetalige reële taken. In tegenstelling tot eerdere benchmarks die afhankelijk zijn van statische, vooraf opgenomen antwoorden, evalueert onze benchmark agenten in live Docker-containers aan de hand van fijnmazige, stapsgewijze voltooiingscontrolepunten. Verder ontwerpen we een evaluatiestrategie in gesloten lus, bestaande uit een uitvoerderagent, een verborgen toezichthouderagent en een gebruikersagent, om realistische meervoudige menselijke feedback te simuleren zonder beoordelingscriteria prijs te geven. Om basismodelcapaciteiten te ontwarren van ontwerpkeuzes op framewerkniveau, evalueren we state-of-the-art modellen onder meerdere agentframeworks. Door uitgebreide vergelijkingen tussen zowel modellen als frameworks tonen we aan hoe basismodelcapaciteiten en agentframeworkontwerpen gezamenlijk de prestaties in reële omgevingen bepalen. Om toekomstig onderzoek te faciliteren, stellen we onze benchmark en code openbaar beschikbaar op https://github.com/HKU-MMLab/UniClawBench.
English
The rapid development of large language models and multimodal large language models has accelerated the emergence of proactive agents capable of operating everyday tools and assisting users in real-world environments. However, existing benchmarks struggle to evaluate such agents effectively, as they often rely on sandboxed environments and single-turn evaluation paradigms. Moreover, their scenario-based task taxonomies mix multiple model capabilities within the same task category, making it difficult to identify the root causes of agent failures. To address these limitations, we introduce UniClawBench, the first capability-driven benchmark designed to evaluate proactive agents in dynamic, real-world settings. UniClawBench is built around five foundational model capabilities: Skill Usage, Exploration, Long-Context Reasoning, Multimodal Understanding, and Cross-Platform Coordination. Based on these capabilities, we design 400 bilingual real-world tasks. Unlike previous benchmarks that rely on static, pre-recorded answers, our benchmark evaluates agents in live Docker containers using fine-grained, step-by-step completion checkpoints. Furthermore, we design a closed-loop evaluation strategy comprising an executor agent, a hidden supervisor agent, and a user agent to simulate realistic multi-turn human feedback without leaking grading criteria. To disentangle base model capabilities from framework-level design choices, we evaluate state-of-the-art models under multiple agent frameworks. Through comprehensive comparisons across both models and frameworks, we show how base model capabilities and agent framework designs jointly shape performance in real-world environments. To facilitate future research, we make our benchmark and code publicly available at https://github.com/HKU-MMLab/UniClawBench.