ChatPaper.aiChatPaper

UniClawBench: Um Benchmark Universal para Agentes Proativos em Tarefas do Mundo Real

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

July 9, 2026
Autores: Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu
cs.AI

Resumo

O rápido desenvolvimento de modelos de linguagem de grande porte e modelos de linguagem multimodais de grande porte acelerou o surgimento de agentes proativos capazes de operar ferramentas cotidianas e auxiliar usuários em ambientes do mundo real. No entanto, os benchmarks existentes têm dificuldade em avaliar tais agentes de forma eficaz, pois frequentemente dependem de ambientes isolados e paradigmas de avaliação de turno único. Além disso, suas taxonomias de tarefas baseadas em cenários misturam múltiplas capacidades dos modelos dentro da mesma categoria de tarefa, dificultando a identificação das causas raiz das falhas dos agentes. Para superar essas limitações, apresentamos o UniClawBench, o primeiro benchmark orientado por capacidades projetado para avaliar agentes proativos em ambientes dinâmicos e reais. O UniClawBench é construído em torno de cinco capacidades fundamentais dos modelos: Uso de Habilidades, Exploração, Raciocínio de Contexto Longo, Compreensão Multimodal e Coordenação entre Plataformas. Com base nessas capacidades, projetamos 400 tarefas bilíngues do mundo real. Diferentemente de benchmarks anteriores que dependem de respostas estáticas e pré-gravadas, nosso benchmark avalia agentes em contêineres Docker ativos, utilizando pontos de verificação de conclusão detalhados e passo a passo. Além disso, projetamos uma estratégia de avaliação em malha fechada composta por um agente executor, um agente supervisor oculto e um agente usuário, para simular feedback humano realista de múltiplos turnos sem vazar critérios de avaliação. Para desvincular as capacidades do modelo base das escolhas de design ao nível da estrutura, avaliamos modelos de última geração sob múltiplas estruturas de agentes. Por meio de comparações abrangentes entre modelos e estruturas, mostramos como as capacidades do modelo base e os designs das estruturas de agentes moldam conjuntamente o desempenho em ambientes reais. Para facilitar pesquisas futuras, disponibilizamos publicamente nosso benchmark e código em https://github.com/HKU-MMLab/UniClawBench.
English
The rapid development of large language models and multimodal large language models has accelerated the emergence of proactive agents capable of operating everyday tools and assisting users in real-world environments. However, existing benchmarks struggle to evaluate such agents effectively, as they often rely on sandboxed environments and single-turn evaluation paradigms. Moreover, their scenario-based task taxonomies mix multiple model capabilities within the same task category, making it difficult to identify the root causes of agent failures. To address these limitations, we introduce UniClawBench, the first capability-driven benchmark designed to evaluate proactive agents in dynamic, real-world settings. UniClawBench is built around five foundational model capabilities: Skill Usage, Exploration, Long-Context Reasoning, Multimodal Understanding, and Cross-Platform Coordination. Based on these capabilities, we design 400 bilingual real-world tasks. Unlike previous benchmarks that rely on static, pre-recorded answers, our benchmark evaluates agents in live Docker containers using fine-grained, step-by-step completion checkpoints. Furthermore, we design a closed-loop evaluation strategy comprising an executor agent, a hidden supervisor agent, and a user agent to simulate realistic multi-turn human feedback without leaking grading criteria. To disentangle base model capabilities from framework-level design choices, we evaluate state-of-the-art models under multiple agent frameworks. Through comprehensive comparisons across both models and frameworks, we show how base model capabilities and agent framework designs jointly shape performance in real-world environments. To facilitate future research, we make our benchmark and code publicly available at https://github.com/HKU-MMLab/UniClawBench.