ChatPaper.aiChatPaper

PrefixGuard: De Rastros de Agentes LLM a Monitores Online de Alerta de Falhas

PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors

May 7, 2026
Autores: Xinmiao Huang, Jinwei Hu, Rajarshi Roy, Changshun Wu, Yi Dong, Xiaowei Huang
cs.AI

Resumo

Agentes de modelo de linguagem de grande porte (LLM) agora executam tarefas longas que utilizam ferramentas, onde as verificações finais de resultados podem chegar tarde demais para intervenção. O alerta online requer monitores de prefixo leves sobre rastreamentos heterogêneos, mas esquemas de eventos criados manualmente são frágeis e a avaliação por LLM em tempo de implantação é custosa. Apresentamos o PrefixGuard, uma estrutura de rastreamento-para-monitor com uma etapa offline de indução StepView seguida de treinamento supervisionado do monitor. O StepView induz adaptadores de etapas tipadas determinísticas a partir de amostras brutas de rastreamento, e o monitor aprende uma abstração de eventos e um pontuador de risco de prefixo a partir dos resultados terminais. Através de WebArena, τ²-Bench, SkillsBench e TerminalBench, os monitores PrefixGuard mais fortes alcançam 0,900/0,710/0,533/0,557 de AUPRC. Usando o backend mais forte dentro de cada representação, eles melhoram em relação aos controles de texto bruto em uma média de +0,137 AUPRC. Os juízes LLM permanecem substancialmente mais fracos sob o mesmo protocolo de alerta de prefixo. Também derivamos um teto de observabilidade para a área sob a curva precisão-revocação (AUPRC) baseada em pontuação, que separa o erro do monitor de falhas que carecem de evidência no prefixo observado. Para auditoria de estado finito, a extração post-hoc de autômato finito determinístico (DFA) permanece compacta no WebArena e τ²-Bench (29 e 20 estados), mas se expande para 151 e 187 estados no SkillsBench e TerminalBench. Finalmente, diagnósticos de primeiro alerta mostram que uma classificação forte não implica utilidade de implantação: o WebArena classifica bem, mas não consegue suportar alertas com baixa taxa de falsos alarmes, enquanto τ²-Bench e TerminalBench retêm alertas precoces mais acionáveis. Juntos, esses resultados posicionam o PrefixGuard como uma receita prática de síntese de monitores com diagnósticos explícitos sobre quando os alertas de prefixo se traduzem em intervenções acionáveis.
English
Large language model (LLM) agents now execute long, tool-using tasks where final outcome checks can arrive too late for intervention. Online warning requires lightweight prefix monitors over heterogeneous traces, but hand-authored event schemas are brittle and deployment-time LLM judging is costly. We introduce PrefixGuard, a trace-to-monitor framework with an offline StepView induction step followed by supervised monitor training. StepView induces deterministic typed-step adapters from raw trace samples, and the monitor learns an event abstraction and prefix-risk scorer from terminal outcomes. Across WebArena, τ^2-Bench, SkillsBench, and TerminalBench, the strongest PrefixGuard monitors reach 0.900/0.710/0.533/0.557 AUPRC. Using the strongest backend within each representation, they improve over raw-text controls by an average of +0.137 AUPRC. LLM judges remain substantially weaker under the same prefix-warning protocol. We also derive an observability ceiling on score-based area under the precision-recall curve (AUPRC) that separates monitor error from failures lacking evidence in the observed prefix. For finite-state audit, post-hoc deterministic finite automaton (DFA) extraction remains compact on WebArena and τ^2-Bench (29 and 20 states) but expands to 151 and 187 states on SkillsBench and TerminalBench. Finally, first-alert diagnostics show that strong ranking does not imply deployment utility: WebArena ranks well yet fails to support low-false-alarm alerts, whereas τ^2-Bench and TerminalBench retain more actionable early alerts. Together, these results position PrefixGuard as a practical monitor-synthesis recipe with explicit diagnostics for when prefix warnings translate into actionable interventions.