UniClawBench: Универсальный бенчмарк для проактивных агентов на реальных задачах
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
July 9, 2026
Авторы: Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu
cs.AI
Аннотация
Бурное развитие больших языковых моделей и мультимодальных больших языковых моделей ускорило появление проактивных агентов, способных работать с повседневными инструментами и помогать пользователям в условиях реального мира. Однако существующие эталоны с трудом справляются с эффективной оценкой таких агентов, поскольку они часто полагаются на изолированные среды и парадигмы однократной оценки. Более того, их сценарные таксономии задач смешивают несколько возможностей модели в одной категории задач, что затрудняет выявление первопричин сбоев агентов. Для устранения этих ограничений мы представляем UniClawBench — первый эталон, основанный на оценке способностей и предназначенный для тестирования проактивных агентов в динамичных условиях реального мира. UniClawBench построен вокруг пяти фундаментальных способностей модели: использование навыков, исследование, рассуждение в длинном контексте, мультимодальное понимание и межплатформенная координация. На основе этих способностей мы разработали 400 двуязычных задач реального мира. В отличие от предыдущих эталонов, использующих статические, заранее записанные ответы, наш эталон оценивает агентов в живых Docker-контейнерах с помощью детализированных пошаговых контрольных точек завершения. Кроме того, мы разработали стратегию оценки с замкнутым циклом, включающую агента-исполнителя, скрытого агента-наблюдателя и агента-пользователя, для имитации реалистичной многошаговой обратной связи от человека без утечки критериев оценки. Чтобы разделить возможности базовых моделей и архитектурные решения на уровне фреймворка, мы оцениваем современные модели в рамках нескольких агентных фреймворков. Благодаря всестороннему сравнению как моделей, так и фреймворков, мы показываем, как возможности базовой модели и дизайн агентного фреймворка совместно формируют производительность в условиях реального мира. Для содействия будущим исследованиям мы делаем наш эталон и код общедоступными по адресу https://github.com/HKU-MMLab/UniClawBench.
English
The rapid development of large language models and multimodal large language models has accelerated the emergence of proactive agents capable of operating everyday tools and assisting users in real-world environments. However, existing benchmarks struggle to evaluate such agents effectively, as they often rely on sandboxed environments and single-turn evaluation paradigms. Moreover, their scenario-based task taxonomies mix multiple model capabilities within the same task category, making it difficult to identify the root causes of agent failures. To address these limitations, we introduce UniClawBench, the first capability-driven benchmark designed to evaluate proactive agents in dynamic, real-world settings. UniClawBench is built around five foundational model capabilities: Skill Usage, Exploration, Long-Context Reasoning, Multimodal Understanding, and Cross-Platform Coordination. Based on these capabilities, we design 400 bilingual real-world tasks. Unlike previous benchmarks that rely on static, pre-recorded answers, our benchmark evaluates agents in live Docker containers using fine-grained, step-by-step completion checkpoints. Furthermore, we design a closed-loop evaluation strategy comprising an executor agent, a hidden supervisor agent, and a user agent to simulate realistic multi-turn human feedback without leaking grading criteria. To disentangle base model capabilities from framework-level design choices, we evaluate state-of-the-art models under multiple agent frameworks. Through comprehensive comparisons across both models and frameworks, we show how base model capabilities and agent framework designs jointly shape performance in real-world environments. To facilitate future research, we make our benchmark and code publicly available at https://github.com/HKU-MMLab/UniClawBench.