ChatPaper.aiChatPaper

AgentLens: Revisões de Trajetória Avaliadas em Produção para Avaliação de Agentes de Codificação

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

July 7, 2026
Autores: Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko
cs.AI

Resumo

Apresentamos o AgentLens, um benchmark avaliado em produção para agentes de código interativos. A maioria dos benchmarks para agentes de código reduz uma execução a um único bit — a tarefa foi bem-sucedida? — mas as pessoas que realmente utilizam esses agentes vivenciam toda a trajetória: como o agente segue instruções, utiliza suas ferramentas, verifica seu próprio trabalho, se recupera de erros e interage com elas ao longo do caminho. O AgentLens avalia essa trajetória completa. Ele combina verificação formal, na qual existe uma checagem objetiva, com revisões de trajetória escritas por LLMs e comparações lado a lado, de modo que cada execução produza uma explicação legível do porquê a pontuação é o que é. Isso torna o AgentLens útil para mais do que apenas ranquear modelos: nós o utilizamos para diagnosticar o comportamento do modelo, comparar versões sucessivas do nosso próprio agente e detectar regressões de produto em um pipeline de avaliação noturna. Disponibilizamos o benchmark como código aberto em https://github.com/agent-lens/agent-lens-bench.
English
We present AgentLens, a production-assessed benchmark for interactive code agents. Most code-agent benchmarks reduce a run to a single bit -- did the task pass? -- but the people who actually use these agents experience the entire trajectory: how the agent follows instructions, uses its tools, verifies its own work, recovers from mistakes, and talks to them along the way. AgentLens evaluates that whole trajectory. It pairs formal verification, where an objective check exists, with LLM-written trajectory reviews and side-by-side comparisons, so that each run yields a readable explanation of why the score is what it is. This makes AgentLens useful for more than ranking models: we use it to diagnose model behavior, compare successive versions of our own agent, and catch product regressions in a nightly evaluation pipeline. We release the benchmark as open source at https://github.com/agent-lens/agent-lens-bench.