ChatPaper.aiChatPaper

Quando os Agentes se Comprometem Cedo Demais: Diagnosticando o Comprometimento Prematuro em Agentes LLM

When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents

June 22, 2026
Autores: Aman Mehta
cs.AI

Resumo

Agentes LLM de horizonte longo podem falhar silenciosamente: eles se fixam em uma interpretação da evidência precocemente e passam o resto da execução defendendo-a. Chamamos isso de compromisso prematuro. A pontuação da resposta final ignora o modo de falha porque vê apenas a resposta, e não se o processo já colapsou para um caminho estável. Definimos compromisso representacional como convergência de estado oculto entre execuções em uma etapa fixa de raciocínio, e o utilizamos como diagnóstico precoce de consistência de trajetória. No Llama-3.1-70B rodando ReAct no HotpotQA, a similaridade do estado oculto no passo 4 prevê consistência comportamental downstream (r = -0,35, r parcial = -0,45), com uma assinatura temporal e por camadas localizada. O sinal se replica nos Qwen-2.5-72B e Phi-3-14B, e no StrategyQA (r = -0,83). Ele não rastreia a correção: perguntas comprometidas-erradas e comprometidas-corretas não são separáveis pela similaridade de ativação. Esse limite é central para a alegação. O compromisso nos diz se um agente se estabilizou, não se está certo. Um monitor de tempo de execução detecta trajetórias inconsistentes a partir de estados ocultos com AUROC de até 0,97 (0,85–0,88 sob uma divisão mais rigorosa), e uma intervenção de prompting reduz a variância comportamental em 28% em comparação com um controle pareado por token, mantendo a precisão estatisticamente inalterada. Também testamos se o sinal pode direcionar o cálculo de autoconsistência; em um benchmark mais difícil, ele ajuda apenas modestamente e é igualado por uma linha de base mais simples baseada em saída. O resultado é um diagnóstico para uma falha de processo oculta, com limites claros, em vez de uma alavanca geral de precisão.
English
Long-horizon LLM agents can fail quietly: they settle on one reading of the evidence early, then spend the rest of the run defending it. We call this premature commitment. Final-answer scoring misses the failure mode because it sees only the answer, not whether the process has already collapsed to a stable path. We define representational commitment as cross-run hidden-state convergence at a fixed reasoning step, and use it as an early diagnostic of trajectory consistency. On Llama-3.1-70B running ReAct on HotpotQA, step-4 hidden-state similarity predicts downstream behavioral consistency (r = -0.35, partial r = -0.45), with a localized temporal and layer-wise signature. The signal replicates across Qwen-2.5-72B and Phi-3-14B, and on StrategyQA (r = -0.83). It does not track correctness: committed-wrong and committed-correct questions are not separable in activation similarity. That boundary is central to the claim. Commitment tells us whether an agent has settled, not whether it is right. A runtime monitor detects inconsistent trajectories from hidden states at AUROC up to 0.97 (0.85--0.88 under a stricter split), and a prompting intervention cuts behavioral variance by 28% against a token-matched control while leaving accuracy statistically unchanged. We also test whether the signal can route self-consistency compute; on a harder benchmark it helps only modestly and is matched by a simpler output-based baseline. The result is a diagnostic for a hidden process failure, with clear limits rather than a general accuracy lever.