AgentLens: Revisiones de Trayectoria Basadas en Producción para la Evaluación de Agentes de Codificación
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
July 7, 2026
Autores: Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko
cs.AI
Resumen
Presentamos AgentLens, un benchmark evaluado en producción para agentes de código interactivos. La mayoría de los benchmarks de agentes de código reducen una ejecución a un solo bit —¿pasó la tarea?— pero las personas que realmente usan estos agentes experimentan la trayectoria completa: cómo el agente sigue instrucciones, utiliza sus herramientas, verifica su propio trabajo, se recupera de errores y se comunica con ellos a lo largo del proceso. AgentLens evalúa toda esa trayectoria. Combina la verificación formal, donde existe una comprobación objetiva, con revisiones de trayectoria escritas por LLM y comparaciones lado a lado, de modo que cada ejecución produce una explicación legible de por qué la puntuación es la que es. Esto hace que AgentLens sea útil para más que simplemente clasificar modelos: lo usamos para diagnosticar el comportamiento del modelo, comparar versiones sucesivas de nuestro propio agente y detectar regresiones de producto en un pipeline de evaluación nocturno. Publicamos el benchmark como código abierto en https://github.com/agent-lens/agent-lens-bench.
English
We present AgentLens, a production-assessed benchmark for interactive code agents. Most code-agent benchmarks reduce a run to a single bit -- did the task pass? -- but the people who actually use these agents experience the entire trajectory: how the agent follows instructions, uses its tools, verifies its own work, recovers from mistakes, and talks to them along the way. AgentLens evaluates that whole trajectory. It pairs formal verification, where an objective check exists, with LLM-written trajectory reviews and side-by-side comparisons, so that each run yields a readable explanation of why the score is what it is. This makes AgentLens useful for more than ranking models: we use it to diagnose model behavior, compare successive versions of our own agent, and catch product regressions in a nightly evaluation pipeline. We release the benchmark as open source at https://github.com/agent-lens/agent-lens-bench.