ChatPaper.aiChatPaper

Étude empirique de l'automatisation de l'évaluation des agents

An Empirical Study of Automating Agent Evaluation

May 12, 2026
Auteurs: Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti Mishra, Vivek Singh, Gouri Pandeshwar, Lin Lee Cheong
cs.AI

Résumé

L'évaluation d'un agent nécessite d'examiner des comportements complexes multi-étapes impliquant l'utilisation d'outils et un raisonnement intermédiaire, ce qui la rend coûteuse et exigeante en expertise. Une question naturelle se pose : les assistants de codage de pointe peuvent-ils automatiser ce processus d'évaluation de manière fiable ? Notre étude montre que le simple fait d'inviter (prompter) des assistants de codage ne suffit pas pour cette tâche. Sans connaissances en évaluation spécifiques au domaine, les assistants de codage de pointe n'atteignent qu'un taux de succès d'exécution de 30 % et produisent des évaluations sur-conçues avec une moyenne de 12 métriques ou plus par agent, ce qui indique que de fortes capacités de codage ne se traduisent pas automatiquement par une évaluation fiable des agents. Nous présentons EvalAgent, un assistant IA qui automatise le pipeline complet d'évaluation des agents, de bout en bout. EvalAgent encode l'expertise en évaluation sous forme de compétences d'évaluation (instructions procédurales, code réutilisable et modèles, ainsi que documentation d'API récupérée dynamiquement) qui se composent en un pipeline basé sur les traces produisant des artefacts d'évaluation complets, incluant métriques, code exécutable et rapports. Pour évaluer systématiquement les évaluations générées, nous introduisons un cadre de méta-évaluation associé à AgentEvalBench, un référentiel comprenant 20 agents, chacun étant jumelé à des exigences d'évaluation et à des scénarios de test. Nous proposons également la métrique Eval@1 pour mesurer si le code d'évaluation généré s'exécute et produit des résultats significatifs dès la première exécution. Nos expériences montrent qu'EvalAgent produit des évaluations ciblées, améliorant Eval@1 de 17,5 % à 65 %, et atteignant une préférence de 79,5 % des experts humains par rapport aux approches de référence. Des études d'ablation supplémentaires montrent que les compétences d'évaluation sont cruciales pour traiter les évaluations complexes : leur suppression entraîne une chute significative d'Eval@1, de 65 % à 30 %.
English
Agent evaluation requires assessing complex multi-step behaviors involving tool use and intermediate reasoning, making it costly and expertise-intensive. A natural question arises: can frontier coding assistants reliably automate this evaluation process? Our study shows that simply prompting coding assistants is insufficient for this task. Without domain-specific evaluation knowledge, frontier coding assistants achieve only a 30% execution success rate and produce over-engineered evaluations averaging 12+ metrics per agent, indicating that strong coding ability does not automatically translate to reliable agent evaluation. We introduce EvalAgent, an AI assistant that automates the end-to-end agent evaluation pipeline. EvalAgent encodes evaluation domain expertise as evaluation skills (procedural instructions, reusable code and templates, and dynamically retrieved API documentation) that compose into a trace-based pipeline producing complete evaluation artifacts including metrics, executable code, and reports. To systematically assess generated evaluations, we introduce a meta-evaluation framework alongside AgentEvalBench, a benchmark comprising 20 agents, each paired with evaluation requirements and test scenarios. We further propose the Eval@1 metric to measure whether generated evaluation code both executes and yields meaningful results on the first run. Our experiments show that EvalAgent produces focused evaluations, improving Eval@1 from 17.5% to 65%, and achieving 79.5% human expert preference over baseline approaches. Further ablation studies show that evaluation skills are critical for handling complex evaluation: removing them causes Eval@1 to drop significantly from 65% to 30%.