ChatPaper.aiChatPaper

LLM-como-Verificador: Um Arcabouço de Verificação de Propósito Geral

LLM-as-a-Verifier: A General-Purpose Verification Framework

July 6, 2026
Autores: Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
cs.AI

Resumo

Escalonar o pré-treinamento, o pós-treinamento e a computação em tempo de teste tornou-se o paradigma central para melhorar as capacidades dos LLMs. Neste trabalho, identificamos a verificação — a capacidade de determinar a correção de uma solução — como um novo eixo de escalonamento. Para desbloquear esse potencial e demonstrar sua eficácia, introduzimos o LLM-como-Verificador, uma estrutura de verificação de propósito geral que fornece feedback granular para tarefas agentivas sem exigir treinamento adicional. Diferentemente dos juízes LM padrão, que instruem LLMs a produzir pontuações discretas para soluções candidatas, o LLM-como-Verificador calcula a expectativa sobre a distribuição dos logits do token de pontuação para gerar pontuações contínuas. Essa formulação probabilística permite que a verificação seja escalonada em múltiplas dimensões: (1) granularidade da pontuação, (2) avaliação repetida e (3) decomposição de critérios. Em particular, mostramos que escalonar a granularidade da pontuação leva a uma melhor separação entre soluções positivas e negativas, resultando em comparações mais calibradas. Além disso, escalonar a avaliação repetida e a decomposição de critérios consistentemente gera ganhos adicionais na precisão da verificação por meio da redução de variância e complexidade. Introduzimos ainda um algoritmo de classificação eficiente em termos de custo para selecionar a melhor solução entre candidatos, utilizando as pontuações contínuas do verificador. O LLM-como-Verificador alcança desempenho de ponta no Terminal-Bench V2 (86,5%), SWE-Bench Verified (78,2%), RoboRewardBench (87,4%) e MedAgentBench (73,3%). Além da verificação, os sinais granulares do LLM-como-Verificador também podem servir como proxy para estimar o progresso da tarefa. Construímos uma extensão para o Claude Code, permitindo que desenvolvedores monitorem e melhorem seus próprios sistemas agentivos. Finalmente, mostramos que o LLM-como-Verificador pode fornecer feedback denso para RL, melhorando a eficiência amostral do SAC e do GRPO em benchmarks de robótica e raciocínio matemático.
English
Scaling pre-training, post-training, and test-time compute have become the central paradigms for improving the capabilities of LLMs. In this work, we identify verification, the ability to determine the correctness of a solution, as a new scaling axis. To unlock this and demonstrate its effectiveness, we introduce LLM-as-a-Verifier, a general-purpose verification framework that provides fine-grained feedback for agentic tasks without requiring additional training. Unlike standard LM judges that prompt LLMs to produce discrete scores for candidate solutions, LLM-as-a-Verifier computes the expectation over the distribution of scoring token logits to generate continuous scores. This probabilistic formulation enables verification to scale along multiple dimensions: (1) score granularity, (2) repeated evaluation, and (3) criteria decomposition. In particular, we show that scaling the scoring granularity leads to better separation between positive and negative solutions, resulting in more calibrated comparisons. Moreover, scaling repeated evaluation and criteria decomposition consistently lead to additional gains in verification accuracy through variance and complexity reduction. We further introduce a cost-efficient ranking algorithm for selecting the best solution among candidates using the verifier's continuous scores. LLM-as-a-Verifier achieves state-of-the-art performance on Terminal-Bench V2 (86.5%), SWE-Bench Verified (78.2%), RoboRewardBench (87.4%), and MedAgentBench (73.3%). Beyond verification, the fine-grained signals from LLM-as-a-Verifier can also serve as a proxy for estimating task progress. We build an extension for Claude Code, enabling developers to monitor and improve their own agentic systems. Finally, we show that LLM-as-a-Verifier can provide dense feedback for RL, improving the sample efficiency of SAC and GRPO on robotics and mathematical reasoning benchmarks.