LLM como verificador: un marco de verificación de propósito general
LLM-as-a-Verifier: A General-Purpose Verification Framework
July 6, 2026
Autores: Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
cs.AI
Resumen
Escalar el preentrenamiento, el postentrenamiento y el cómputo en tiempo de prueba se ha convertido en el paradigma central para mejorar las capacidades de los LLM. En este trabajo, identificamos la verificación —la capacidad de determinar la corrección de una solución— como un nuevo eje de escalado. Para desbloquear esta capacidad y demostrar su efectividad, presentamos LLM-as-a-Verifier, un marco de verificación de propósito general que proporciona retroalimentación detallada para tareas agentivas sin requerir entrenamiento adicional. A diferencia de los jueces de LM estándar, que incitan a los LLM a producir puntuaciones discretas para soluciones candidatas, LLM-as-a-Verifier calcula la expectativa sobre la distribución de los logits de los tokens de puntuación para generar puntuaciones continuas. Esta formulación probabilística permite que la verificación escale en múltiples dimensiones: (1) granularidad de la puntuación, (2) evaluación repetida y (3) descomposición de criterios. En particular, mostramos que escalar la granularidad de la puntuación conduce a una mejor separación entre soluciones positivas y negativas, resultando en comparaciones más calibradas. Además, escalar la evaluación repetida y la descomposición de criterios genera consistentemente ganancias adicionales en precisión de verificación mediante la reducción de varianza y complejidad. Asimismo, introducimos un algoritmo de ranking eficiente en coste para seleccionar la mejor solución entre candidatos utilizando las puntuaciones continuas del verificador. LLM-as-a-Verifier alcanza un rendimiento de vanguardia en Terminal-Bench V2 (86,5%), SWE-Bench Verified (78,2%), RoboRewardBench (87,4%) y MedAgentBench (73,3%). Más allá de la verificación, las señales detalladas de LLM-as-a-Verifier también pueden servir como proxy para estimar el progreso de la tarea. Construimos una extensión para Claude Code que permite a los desarrolladores monitorear y mejorar sus propios sistemas agentivos. Finalmente, mostramos que LLM-as-a-Verifier puede proporcionar retroalimentación densa para el aprendizaje por refuerzo (RL), mejorando la eficiencia de muestra de SAC y GRPO en benchmarks de robótica y razonamiento matemático.
English
Scaling pre-training, post-training, and test-time compute have become the central paradigms for improving the capabilities of LLMs. In this work, we identify verification, the ability to determine the correctness of a solution, as a new scaling axis. To unlock this and demonstrate its effectiveness, we introduce LLM-as-a-Verifier, a general-purpose verification framework that provides fine-grained feedback for agentic tasks without requiring additional training. Unlike standard LM judges that prompt LLMs to produce discrete scores for candidate solutions, LLM-as-a-Verifier computes the expectation over the distribution of scoring token logits to generate continuous scores. This probabilistic formulation enables verification to scale along multiple dimensions: (1) score granularity, (2) repeated evaluation, and (3) criteria decomposition. In particular, we show that scaling the scoring granularity leads to better separation between positive and negative solutions, resulting in more calibrated comparisons. Moreover, scaling repeated evaluation and criteria decomposition consistently lead to additional gains in verification accuracy through variance and complexity reduction. We further introduce a cost-efficient ranking algorithm for selecting the best solution among candidates using the verifier's continuous scores. LLM-as-a-Verifier achieves state-of-the-art performance on Terminal-Bench V2 (86.5%), SWE-Bench Verified (78.2%), RoboRewardBench (87.4%), and MedAgentBench (73.3%). Beyond verification, the fine-grained signals from LLM-as-a-Verifier can also serve as a proxy for estimating task progress. We build an extension for Claude Code, enabling developers to monitor and improve their own agentic systems. Finally, we show that LLM-as-a-Verifier can provide dense feedback for RL, improving the sample efficiency of SAC and GRPO on robotics and mathematical reasoning benchmarks.