ChatPaper.aiChatPaper

AgentLens: Productiegeëvalueerde Trajectbeoordelingen voor Codeeragent-Evaluatie

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

July 7, 2026
Auteurs: Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko
cs.AI

Samenvatting

Wij presenteren AgentLens, een productie-geëvalueerde benchmark voor interactieve code-agenten. De meeste benchmarks voor code-agenten reduceren een uitvoering tot een enkele bit — is de taak geslaagd? — maar de mensen die deze agenten daadwerkelijk gebruiken ervaren het gehele traject: hoe de agent instructies opvolgt, zijn tools gebruikt, zijn eigen werk verifieert, herstelt van fouten, en onderweg met hen communiceert. AgentLens evalueert dat volledige traject. Het combineert formele verificatie, waarbij een objectieve controle bestaat, met door LLM geschreven trajectbeoordelingen en zij-aan-zij-vergelijkingen, zodat elke uitvoering een leesbare verklaring oplevert van waarom de score is wat die is. Dit maakt AgentLens nuttig voor meer dan alleen het rangschikken van modellen: we gebruiken het om modelgedrag te diagnosticeren, opeenvolgende versies van onze eigen agent te vergelijken, en productregressies op te sporen in een nachtelijke evaluatiepijplijn. We publiceren de benchmark als open source op https://github.com/agent-lens/agent-lens-bench.
English
We present AgentLens, a production-assessed benchmark for interactive code agents. Most code-agent benchmarks reduce a run to a single bit -- did the task pass? -- but the people who actually use these agents experience the entire trajectory: how the agent follows instructions, uses its tools, verifies its own work, recovers from mistakes, and talks to them along the way. AgentLens evaluates that whole trajectory. It pairs formal verification, where an objective check exists, with LLM-written trajectory reviews and side-by-side comparisons, so that each run yields a readable explanation of why the score is what it is. This makes AgentLens useful for more than ranking models: we use it to diagnose model behavior, compare successive versions of our own agent, and catch product regressions in a nightly evaluation pipeline. We release the benchmark as open source at https://github.com/agent-lens/agent-lens-bench.