AgentLens : Revues de trajectoire basées sur la production pour l'évaluation d'agents de codage
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
July 7, 2026
Auteurs: Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko
cs.AI
Résumé
Nous présentons AgentLens, un benchmark évalué en production pour les agents de code interactifs. La plupart des benchmarks pour agents de code réduisent une exécution à un seul bit — la tâche a-t-elle été réussie ? — mais les personnes qui utilisent réellement ces agents font l’expérience de l’intégralité de la trajectoire : comment l’agent suit les instructions, utilise ses outils, vérifie son propre travail, se remet de ses erreurs et communique avec elles tout au long du processus. AgentLens évalue cette trajectoire dans son ensemble. Il associe une vérification formelle, lorsqu’un contrôle objectif existe, à des revues de trajectoire rédigées par LLM et à des comparaisons côte à côte, de sorte que chaque exécution fournisse une explication lisible de la raison pour laquelle le score est ce qu’il est. Cela rend AgentLens utile au-delà du simple classement des modèles : nous l’utilisons pour diagnostiquer le comportement des modèles, comparer les versions successives de notre propre agent et détecter les régressions produit dans un pipeline d’évaluation nocturne. Nous publions le benchmark en open source à l’adresse https://github.com/agent-lens/agent-lens-bench.
English
We present AgentLens, a production-assessed benchmark for interactive code agents. Most code-agent benchmarks reduce a run to a single bit -- did the task pass? -- but the people who actually use these agents experience the entire trajectory: how the agent follows instructions, uses its tools, verifies its own work, recovers from mistakes, and talks to them along the way. AgentLens evaluates that whole trajectory. It pairs formal verification, where an objective check exists, with LLM-written trajectory reviews and side-by-side comparisons, so that each run yields a readable explanation of why the score is what it is. This makes AgentLens useful for more than ranking models: we use it to diagnose model behavior, compare successive versions of our own agent, and catch product regressions in a nightly evaluation pipeline. We release the benchmark as open source at https://github.com/agent-lens/agent-lens-bench.