ChatPaper.aiChatPaper

CalVerT: Aumentar Agentes com Telemetria de Verificador Calibrado Melhora a Ação e a Aprendizagem em Tarefas Intensivas em Conhecimento

CalVerT: Augmenting Agents with Calibrated Verifier Telemetry Improves Action and Learning in Knowledge-Intensive Tasks

June 19, 2026
Autores: Ashwin Vinod, Ying Ding, Elias Stengel-Eskin
cs.AI

Resumo

Agentes de LLM em resposta a perguntas com uso intensivo de conhecimento realizam ações de recuperação e raciocínio com conhecimento incompleto sobre se sua resposta atual é incerta, não fundamentada ou já completa. Isso produz dois modos de falha: comprometer-se com respostas confiantes, mas não fundamentadas, o que prejudica a precisão, e recuperar em excesso quando as evidências já disponíveis são suficientes, resultando em desperdício computacional. Para fornecer aos agentes uma visão mais completa do espaço de estados em que operam, introduzimos a telemetria de verificador calibrado (CalVerT), que aumenta o estado do agente com telemetria adicional: uma pontuação de autoconfiança calibrada e uma pontuação do verificador de fundamentação. Mostramos que o CalVerT pode melhorar agentes tanto em configurações sem treinamento quanto baseadas em treinamento. Em quatro referenciais de QA, descobrimos que o CalVerT eleva o F1 ao acionar a recuperação em casos onde os agentes confiam excessivamente no conhecimento paramétrico, enquanto reduz a recuperação redundante em casos onde os agentes possuem contexto suficiente para responder. Demonstramos que o CalVerT pode aumentar estruturas de QA existentes sem treinamento. Além disso, o CalVerT também melhora sistemas treinados: ao simplesmente aumentar o estado de um agente com telemetria, observamos melhorias após aprendizado por reforço, em comparação com um agente com treinamento idêntico, mas sem telemetria CalVerT.
English
LLM agents in knowledge intensive question answering take retrieval and reasoning actions with incomplete knowledge about whether their current answer is uncertain, unsupported, or already complete. This produces two failure modes: committing to confident but unsupported answers, which hurts accuracy, and over-retrieving when the evidence in hand already suffices, resulting in wasted compute. To give agents a more complete picture of the state space they are operating in, we introduce calibrated verifier telemetry (CalVerT), which augments the agent's state with additional telemetry: a calibrated self-confidence score and a grounding verifier score. We show that CalVerT can improve agents in both training-free and training-based settings. On four QA benchmarks, we find that CalVerT raises F1 by triggering retrieval in cases where agents over-rely on parametric knowledge, while cutting redundant retrieval in cases where agents have sufficient context to answer. We show that CalVerT can augment existing QA frameworks without training. Moreover, CalVerT also improves trained systems: by simply augmenting an agent's state with telemetry, we observe improvements after reinforcement learning, as compared to an agent with identical training but no CalVerT telemetry.