AgentCompass : une infrastructure d'évaluation unifiée pour les capacités des agents
AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
July 15, 2026
Auteurs: Zichen Ding, Jiaye Ge, Shufan Jiang, Kai Chen, Mo Li, Qingqiu Li, Zehao Li, Zonglin Li, Tiaohao Liang, Shudong Liu, Zerun Ma, Zixing Shang, Wenhui Tian, Zun Wang, Liwei Wu, Zhenyu Wu, Jun Xu, Bowen Yang, Dingbo Yuan, Qi Zhang, Songyang Zhang, Peiheng Zhou, Dongsheng Zhu
cs.AI
Résumé
Alors que les grands modèles de langage (LLMs) évoluent vers des agents autonomes, le besoin d’une infrastructure d’évaluation unifiée devient crucial. Cependant, les pipelines d’évaluation actuels restent très fragmentés et fortement couplés, ce qui nuit à la reproductibilité et entraîne des efforts d’ingénierie redondants. Pour répondre à ce problème, nous présentons AgentCompass, une infrastructure open-source, légère et extensible pour l’évaluation des agents basés sur les LLM. AgentCompass organise le processus d’évaluation autour de trois composants indépendants — Benchmark, Harness et Environment — permettant ainsi des configurations flexibles sans nécessiter la réimplémentation de logiques d’exécution complexes. De plus, il intègre un environnement d’exécution asynchrone tolérant aux pannes ainsi que des outils complets d’analyse de trajectoire pour diagnostiquer de manière transparente des modes de défaillance subtils tels que le détournement de récompense (reward-hacking). En prenant en charge nativement plus de 20 benchmarks couvrant cinq dimensions de capacité, AgentCompass offre à la communauté une infrastructure évolutive et reproductible pour faire progresser la recherche sur les agents.
English
As Large Language Models (LLMs) evolve into autonomous agents, the need for unified evaluation infrastructure becomes critical. However, current evaluation pipelines remain highly fragmented and tightly coupled, hindering reproducibility and causing redundant engineering. To address this, we introduce AgentCompass, an open-source, lightweight, and extensible infrastructure for evaluating LLM-based agents. AgentCompass organizes the evaluation process around three independent components, namely Benchmark, Harness, and Environment, thereby enabling flexible configurations without requiring the reimplementation of complex execution logic. Furthermore, it features a fault-tolerant asynchronous runtime and comprehensive trajectory analysis tools to transparently diagnose nuanced failure modes like reward-hacking. Natively supporting over 20 benchmarks across five capability dimensions, AgentCompass provides the community with a scalable and reproducible infrastructure for advancing agent research.