ChatPaper.aiChatPaper

AgentLens: Производственная оценка траекторий для оценки агентов программирования

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

July 7, 2026
Авторы: Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko
cs.AI

Аннотация

Мы представляем AgentLens — бенчмарк, оцененный в продукционной среде, для интерактивных кодовых агентов. Большинство бенчмарков для кодовых агентов сводят выполнение к одному биту — пройдена ли задача? — но люди, которые действительно используют этих агентов, наблюдают всю траекторию: как агент следует инструкциям, использует свои инструменты, проверяет собственную работу, восстанавливается после ошибок и общается с ними по ходу дела. AgentLens оценивает всю эту траекторию. Он объединяет формальную верификацию (где существует объективная проверка) с обзорами траектории, написанными LLM, и попарными сравнениями, так что каждый запуск дает читаемое объяснение того, почему оценка именно такая. Это делает AgentLens полезным не только для ранжирования моделей: мы используем его для диагностики поведения моделей, сравнения последовательных версий нашего собственного агента и выявления регрессий продукта в ежедневном конвейере оценки. Мы публикуем бенчмарк в открытом доступе по адресу https://github.com/agent-lens/agent-lens-bench.
English
We present AgentLens, a production-assessed benchmark for interactive code agents. Most code-agent benchmarks reduce a run to a single bit -- did the task pass? -- but the people who actually use these agents experience the entire trajectory: how the agent follows instructions, uses its tools, verifies its own work, recovers from mistakes, and talks to them along the way. AgentLens evaluates that whole trajectory. It pairs formal verification, where an objective check exists, with LLM-written trajectory reviews and side-by-side comparisons, so that each run yields a readable explanation of why the score is what it is. This makes AgentLens useful for more than ranking models: we use it to diagnose model behavior, compare successive versions of our own agent, and catch product regressions in a nightly evaluation pipeline. We release the benchmark as open source at https://github.com/agent-lens/agent-lens-bench.