ChatPaper.aiChatPaper

UniClawBench: Un Benchmark Universal para Agentes Proactivos en Tareas del Mundo Real

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

July 9, 2026
Autores: Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu
cs.AI

Resumen

El rápido desarrollo de los modelos de lenguaje extensos y los modelos multimodales de lenguaje extenso ha acelerado la aparición de agentes proactivos capaces de operar herramientas cotidianas y asistir a los usuarios en entornos reales. Sin embargo, los puntos de referencia existentes tienen dificultades para evaluar eficazmente a dichos agentes, ya que a menudo dependen de entornos aislados y paradigmas de evaluación de una sola ronda. Además, sus taxonomías de tareas basadas en escenarios mezclan múltiples capacidades del modelo dentro de la misma categoría de tarea, lo que dificulta identificar las causas raíz de los fallos de los agentes. Para abordar estas limitaciones, presentamos UniClawBench, el primer punto de referencia impulsado por capacidades diseñado para evaluar agentes proactivos en entornos dinámicos y reales. UniClawBench se construye en torno a cinco capacidades fundamentales del modelo: Uso de Habilidades, Exploración, Razonamiento de Contexto Largo, Comprensión Multimodal y Coordinación Multiplataforma. Basándonos en estas capacidades, diseñamos 400 tareas bilingües del mundo real. A diferencia de los puntos de referencia anteriores que dependen de respuestas estáticas pregrabadas, nuestro punto de referencia evalúa a los agentes en contenedores Docker en vivo utilizando puntos de control de finalización detallados y paso a paso. Además, diseñamos una estrategia de evaluación de bucle cerrado que comprende un agente ejecutor, un agente supervisor oculto y un agente usuario para simular retroalimentación humana realista de múltiples turnos sin filtrar los criterios de calificación. Para separar las capacidades base del modelo de las decisiones de diseño a nivel del marco, evaluamos los modelos de última generación bajo múltiples marcos de agentes. Mediante comparaciones exhaustivas tanto entre modelos como entre marcos, mostramos cómo las capacidades base del modelo y los diseños del marco de agentes moldean conjuntamente el rendimiento en entornos reales. Para facilitar futuras investigaciones, ponemos a disposición del público nuestro punto de referencia y código en https://github.com/HKU-MMLab/UniClawBench.
English
The rapid development of large language models and multimodal large language models has accelerated the emergence of proactive agents capable of operating everyday tools and assisting users in real-world environments. However, existing benchmarks struggle to evaluate such agents effectively, as they often rely on sandboxed environments and single-turn evaluation paradigms. Moreover, their scenario-based task taxonomies mix multiple model capabilities within the same task category, making it difficult to identify the root causes of agent failures. To address these limitations, we introduce UniClawBench, the first capability-driven benchmark designed to evaluate proactive agents in dynamic, real-world settings. UniClawBench is built around five foundational model capabilities: Skill Usage, Exploration, Long-Context Reasoning, Multimodal Understanding, and Cross-Platform Coordination. Based on these capabilities, we design 400 bilingual real-world tasks. Unlike previous benchmarks that rely on static, pre-recorded answers, our benchmark evaluates agents in live Docker containers using fine-grained, step-by-step completion checkpoints. Furthermore, we design a closed-loop evaluation strategy comprising an executor agent, a hidden supervisor agent, and a user agent to simulate realistic multi-turn human feedback without leaking grading criteria. To disentangle base model capabilities from framework-level design choices, we evaluate state-of-the-art models under multiple agent frameworks. Through comprehensive comparisons across both models and frameworks, we show how base model capabilities and agent framework designs jointly shape performance in real-world environments. To facilitate future research, we make our benchmark and code publicly available at https://github.com/HKU-MMLab/UniClawBench.