ChatPaper.aiChatPaper

LLM как верификатор: универсальный фреймворк верификации

LLM-as-a-Verifier: A General-Purpose Verification Framework

July 6, 2026
Авторы: Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
cs.AI

Аннотация

Масштабирование предобучения, постобучения и вычислительных ресурсов на этапе тестирования стало центральной парадигмой для улучшения возможностей больших языковых моделей (LLM). В данной работе мы выделяем верификацию — способность определять корректность решения — как новую ось масштабирования. Для её реализации и демонстрации эффективности мы представляем LLM-as-a-Verifier — универсальный фреймворк верификации, предоставляющий детализированную обратную связь для агентных задач без необходимости дополнительного обучения. В отличие от стандартных судей на основе языковых моделей, которые побуждают LLM выдавать дискретные оценки для решений-кандидатов, LLM-as-a-Verifier вычисляет математическое ожидание по распределению логитов оценочных токенов для генерации непрерывных оценок. Такая вероятностная формулировка позволяет масштабировать верификацию по нескольким измерениям: (1) гранулярность оценивания, (2) повторное оценивание и (3) декомпозиция критериев. В частности, мы показываем, что масштабирование гранулярности оценивания улучшает разделение положительных и отрицательных решений, что приводит к более калиброванным сравнениям. Кроме того, масштабирование повторного оценивания и декомпозиции критериев последовательно даёт дополнительный прирост точности верификации за счёт снижения дисперсии и сложности. Мы также предлагаем экономичный алгоритм ранжирования для выбора наилучшего решения среди кандидатов, использующий непрерывные оценки верификатора. LLM-as-a-Verifier достигает современного качества на наборах данных Terminal-Bench V2 (86,5%), SWE-Bench Verified (78,2%), RoboRewardBench (87,4%) и MedAgentBench (73,3%). Помимо верификации, детализированные сигналы от LLM-as-a-Verifier могут служить прокси для оценки прогресса задачи. Мы создали расширение для Claude Code, позволяющее разработчикам отслеживать и улучшать собственные агентные системы. Наконец, мы показываем, что LLM-as-a-Verifier может предоставлять плотную обратную связь для обучения с подкреплением (RL), повышая эффективность выборки алгоритмов SAC и GRPO в задачах робототехники и математического рассуждения.
English
Scaling pre-training, post-training, and test-time compute have become the central paradigms for improving the capabilities of LLMs. In this work, we identify verification, the ability to determine the correctness of a solution, as a new scaling axis. To unlock this and demonstrate its effectiveness, we introduce LLM-as-a-Verifier, a general-purpose verification framework that provides fine-grained feedback for agentic tasks without requiring additional training. Unlike standard LM judges that prompt LLMs to produce discrete scores for candidate solutions, LLM-as-a-Verifier computes the expectation over the distribution of scoring token logits to generate continuous scores. This probabilistic formulation enables verification to scale along multiple dimensions: (1) score granularity, (2) repeated evaluation, and (3) criteria decomposition. In particular, we show that scaling the scoring granularity leads to better separation between positive and negative solutions, resulting in more calibrated comparisons. Moreover, scaling repeated evaluation and criteria decomposition consistently lead to additional gains in verification accuracy through variance and complexity reduction. We further introduce a cost-efficient ranking algorithm for selecting the best solution among candidates using the verifier's continuous scores. LLM-as-a-Verifier achieves state-of-the-art performance on Terminal-Bench V2 (86.5%), SWE-Bench Verified (78.2%), RoboRewardBench (87.4%), and MedAgentBench (73.3%). Beyond verification, the fine-grained signals from LLM-as-a-Verifier can also serve as a proxy for estimating task progress. We build an extension for Claude Code, enabling developers to monitor and improve their own agentic systems. Finally, we show that LLM-as-a-Verifier can provide dense feedback for RL, improving the sample efficiency of SAC and GRPO on robotics and mathematical reasoning benchmarks.