ChatPaper.aiChatPaper

UniClawBench : un benchmark universel pour agents proactifs sur des tâches du monde réel

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

July 9, 2026
Auteurs: Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu
cs.AI

Résumé

Le développement rapide des modèles de langage de grande taille et des modèles de langage multimodaux de grande taille a accéléré l'émergence d'agents proactifs capables d'utiliser des outils courants et d'assister les utilisateurs dans des environnements du monde réel. Cependant, les bancs d'essai existants peinent à évaluer efficacement ces agents, car ils s'appuient souvent sur des environnements cloisonnés et des paradigmes d'évaluation à tour unique. De plus, leurs taxonomies de tâches basées sur des scénarios mélangent plusieurs capacités de modèle au sein d'une même catégorie de tâches, rendant difficile l'identification des causes profondes des défaillances des agents. Pour remédier à ces limitations, nous présentons UniClawBench, le premier banc d'essai axé sur les capacités, conçu pour évaluer les agents proactifs dans des environnements dynamiques et réels. UniClawBench est construit autour de cinq capacités fondamentales de modèle : l'Utilisation des compétences, l'Exploration, le Raisonnement sur de longs contextes, la Compréhension multimodale et la Coordination multiplateforme. Sur la base de ces capacités, nous concevons 400 tâches bilingues du monde réel. Contrairement aux bancs d'essai précédents qui reposent sur des réponses statiques préenregistrées, notre banc d'essai évalue les agents dans des conteneurs Docker en direct à l'aide de points de contrôle granulaires, étape par étape, pour mesurer l'achèvement. De plus, nous élaborons une stratégie d'évaluation en boucle fermée comprenant un agent exécuteur, un agent superviseur caché et un agent utilisateur afin de simuler un retour d'information humain multitour réaliste sans divulguer les critères de notation. Pour dissocier les capacités des modèles de base des choix de conception au niveau du framework, nous évaluons les modèles les plus avancés sous plusieurs frameworks d'agents. Grâce à des comparaisons exhaustives entre modèles et frameworks, nous montrons comment les capacités des modèles de base et les conceptions des frameworks d'agents façonnent conjointement les performances dans des environnements réels. Pour faciliter les recherches futures, nous mettons notre banc d'essai et notre code à disposition du public à l'adresse https://github.com/HKU-MMLab/UniClawBench.
English
The rapid development of large language models and multimodal large language models has accelerated the emergence of proactive agents capable of operating everyday tools and assisting users in real-world environments. However, existing benchmarks struggle to evaluate such agents effectively, as they often rely on sandboxed environments and single-turn evaluation paradigms. Moreover, their scenario-based task taxonomies mix multiple model capabilities within the same task category, making it difficult to identify the root causes of agent failures. To address these limitations, we introduce UniClawBench, the first capability-driven benchmark designed to evaluate proactive agents in dynamic, real-world settings. UniClawBench is built around five foundational model capabilities: Skill Usage, Exploration, Long-Context Reasoning, Multimodal Understanding, and Cross-Platform Coordination. Based on these capabilities, we design 400 bilingual real-world tasks. Unlike previous benchmarks that rely on static, pre-recorded answers, our benchmark evaluates agents in live Docker containers using fine-grained, step-by-step completion checkpoints. Furthermore, we design a closed-loop evaluation strategy comprising an executor agent, a hidden supervisor agent, and a user agent to simulate realistic multi-turn human feedback without leaking grading criteria. To disentangle base model capabilities from framework-level design choices, we evaluate state-of-the-art models under multiple agent frameworks. Through comprehensive comparisons across both models and frameworks, we show how base model capabilities and agent framework designs jointly shape performance in real-world environments. To facilitate future research, we make our benchmark and code publicly available at https://github.com/HKU-MMLab/UniClawBench.