ChatPaper.aiChatPaper

AgentCompass: Una Infraestructura de Evaluación Unificada para Capacidades de Agentes

AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities

July 15, 2026
Autores: Zichen Ding, Jiaye Ge, Shufan Jiang, Kai Chen, Mo Li, Qingqiu Li, Zehao Li, Zonglin Li, Tiaohao Liang, Shudong Liu, Zerun Ma, Zixing Shang, Wenhui Tian, Zun Wang, Liwei Wu, Zhenyu Wu, Jun Xu, Bowen Yang, Dingbo Yuan, Qi Zhang, Songyang Zhang, Peiheng Zhou, Dongsheng Zhu
cs.AI

Resumen

A medida que los Modelos de Lenguaje de Gran Escala (LLMs) evolucionan hacia agentes autónomos, la necesidad de una infraestructura de evaluación unificada se vuelve crítica. Sin embargo, los pipelines de evaluación actuales siguen estando altamente fragmentados y estrechamente acoplados, lo que dificulta la reproducibilidad y provoca redundancia en la ingeniería. Para abordar esto, presentamos AgentCompass, una infraestructura de código abierto, ligera y extensible para evaluar agentes basados en LLMs. AgentCompass organiza el proceso de evaluación en torno a tres componentes independientes, a saber, Benchmark, Harness y Environment, permitiendo así configuraciones flexibles sin requerir la reimplementación de lógica de ejecución compleja. Además, cuenta con un entorno de ejecución asíncrono tolerante a fallos y herramientas exhaustivas de análisis de trayectorias para diagnosticar de forma transparente modos de fallo sutiles como el _reward hacking_. Al soportar de manera nativa más de 20 benchmarks en cinco dimensiones de capacidad, AgentCompass proporciona a la comunidad una infraestructura escalable y reproducible para avanzar en la investigación de agentes.
English
As Large Language Models (LLMs) evolve into autonomous agents, the need for unified evaluation infrastructure becomes critical. However, current evaluation pipelines remain highly fragmented and tightly coupled, hindering reproducibility and causing redundant engineering. To address this, we introduce AgentCompass, an open-source, lightweight, and extensible infrastructure for evaluating LLM-based agents. AgentCompass organizes the evaluation process around three independent components, namely Benchmark, Harness, and Environment, thereby enabling flexible configurations without requiring the reimplementation of complex execution logic. Furthermore, it features a fault-tolerant asynchronous runtime and comprehensive trajectory analysis tools to transparently diagnose nuanced failure modes like reward-hacking. Natively supporting over 20 benchmarks across five capability dimensions, AgentCompass provides the community with a scalable and reproducible infrastructure for advancing agent research.