ChatPaper.aiChatPaper

LLM en tant que vérificateur : un cadre de vérification polyvalent

LLM-as-a-Verifier: A General-Purpose Verification Framework

July 6, 2026
Auteurs: Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
cs.AI

Résumé

La mise à l'échelle du pré-entraînement, du post-entraînement et du calcul en phase de test est devenue le paradigme central pour améliorer les capacités des LLM. Dans ce travail, nous identifions la vérification – capacité à déterminer la correction d'une solution – comme un nouvel axe de mise à l'échelle. Pour exploiter cette dimension et démontrer son efficacité, nous introduisons LLM-en-tant-que-Vérificateur, un cadre de vérification polyvalent fournissant un retour d'information fin pour les tâches agentiques sans nécessiter d'entraînement supplémentaire. Contrairement aux juges LM standards qui incitent les LLM à produire des scores discrets pour des solutions candidates, LLM-en-tant-que-Vérificateur calcule l'espérance sur la distribution des logits des tokens de notation afin de générer des scores continus. Cette formulation probabiliste permet à la vérification de passer à l'échelle selon plusieurs dimensions : (1) la granularité des scores, (2) l'évaluation répétée et (3) la décomposition des critères. En particulier, nous montrons que la mise à l'échelle de la granularité des scores conduit à une meilleure séparation entre solutions positives et négatives, ce qui permet des comparaisons plus calibrées. De plus, la mise à l'échelle de l'évaluation répétée et de la décomposition des critères produit systématiquement des gains supplémentaires en précision de vérification grâce à la réduction de la variance et de la complexité. Nous introduisons également un algorithme de classement économique pour sélectionner la meilleure solution parmi les candidates en utilisant les scores continus du vérificateur. LLM-en-tant-que-Vérificateur atteint des performances de pointe sur Terminal-Bench V2 (86,5 %), SWE-Bench Verified (78,2 %), RoboRewardBench (87,4 %) et MedAgentBench (73,3 %). Au-delà de la vérification, les signaux fins de LLM-en-tant-que-Vérificateur peuvent également servir de proxy pour estimer la progression de la tâche. Nous construisons une extension pour Claude Code, permettant aux développeurs de surveiller et d'améliorer leurs propres systèmes agentiques. Enfin, nous montrons que LLM-en-tant-que-Vérificateur peut fournir un retour d'information dense pour l'apprentissage par renforcement, améliorant l'efficacité d'échantillonnage de SAC et GRPO sur des benchmarks de robotique et de raisonnement mathématique.
English
Scaling pre-training, post-training, and test-time compute have become the central paradigms for improving the capabilities of LLMs. In this work, we identify verification, the ability to determine the correctness of a solution, as a new scaling axis. To unlock this and demonstrate its effectiveness, we introduce LLM-as-a-Verifier, a general-purpose verification framework that provides fine-grained feedback for agentic tasks without requiring additional training. Unlike standard LM judges that prompt LLMs to produce discrete scores for candidate solutions, LLM-as-a-Verifier computes the expectation over the distribution of scoring token logits to generate continuous scores. This probabilistic formulation enables verification to scale along multiple dimensions: (1) score granularity, (2) repeated evaluation, and (3) criteria decomposition. In particular, we show that scaling the scoring granularity leads to better separation between positive and negative solutions, resulting in more calibrated comparisons. Moreover, scaling repeated evaluation and criteria decomposition consistently lead to additional gains in verification accuracy through variance and complexity reduction. We further introduce a cost-efficient ranking algorithm for selecting the best solution among candidates using the verifier's continuous scores. LLM-as-a-Verifier achieves state-of-the-art performance on Terminal-Bench V2 (86.5%), SWE-Bench Verified (78.2%), RoboRewardBench (87.4%), and MedAgentBench (73.3%). Beyond verification, the fine-grained signals from LLM-as-a-Verifier can also serve as a proxy for estimating task progress. We build an extension for Claude Code, enabling developers to monitor and improve their own agentic systems. Finally, we show that LLM-as-a-Verifier can provide dense feedback for RL, improving the sample efficiency of SAC and GRPO on robotics and mathematical reasoning benchmarks.