ChatPaper.aiChatPaper

AgentForesight: Auditoria Online para Previsão Antecipada de Falhas em Sistemas Multiagente

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems

May 9, 2026
Autores: Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang
cs.AI

Resumo

Sistemas multiagentes baseados em LLMs são cada vez mais implantados em tarefas de longo horizonte, mas um único erro decisivo é frequentemente aceito por agentes downstream e se propaga em falhas ao nível da trajetória. Trabalhos existentes enquadram isso como atribuição de falhas post-hoc, diagnosticando o agente responsável e a etapa após o término da trajetória. No entanto, esse paradigma abdica de qualquer oportunidade de intervenção enquanto a trajetória ainda está em andamento. Neste trabalho, introduzimos o AgentForesight, uma estrutura que reformula esse problema como auditoria online: a cada etapa de uma trajetória em desenvolvimento, um auditor observa apenas o prefixo atual e deve continuar a execução ou disparar um alerta no momento do erro decisivo mais precoce, sem acesso a etapas futuras. Para isso, curamos o AFTraj-2K, um corpus de trajetórias agentivas nos domínios de Codificação, Matemática e Agentes, no qual trajetórias seguras são retidas sob um pipeline de curadoria rigoroso e trajetórias inseguras são anotadas no passo do seu erro decisivo por consenso entre múltiplos juízes LLM. Com base nisso, desenvolvemos o AgentForesight-7B, um auditor online compacto treinado com uma abordagem de aprendizado por reforço de grosseiro a fino que primeiro o equipa com um prior de antecipação de risco no limite de falha em pares adjacentes de prefixos seguros/inseguros, e então refina esse prior em localização precisa ao nível da etapa sob uma recompensa de três eixos que visa simultaneamente o quê, onde e quem de um veredito de auditoria. Em todo o AFTraj-2K e em um benchmark externo Who\&When, o AgentForesight-7B supera modelos proprietários de ponta, incluindo GPT-4.1 e DeepSeek-V4-Pro, alcançando ganhos de desempenho de até +19,9% e erro de localização de etapa 3 vezes menor, abrindo o ciclo de detecção de falhas post-hoc para permitir intervenção em tempo de implantação. Página do projeto: https://zbox1005.github.io/agent-foresight/
English
LLM-based multi-agent systems are increasingly deployed on long-horizon tasks, but a single decisive error is often accepted by downstream agents and cascades into trajectory-level failure. Existing work frames this as post-hoc failure attribution, diagnosing the responsible agent and step after the trajectory has ended. However, this paradigm forfeits any opportunity to intervene while trajectory is still unfolding. In this work, we introduce AgentForesight, a framework that reframes this problem as online auditing: at each step of an unfolding trajectory, an auditor observes only the current prefix and must either continue the run or alarm at the earliest decisive error, without access to future steps. To this end, we curate AFTraj-2K, a corpus of agentic trajectories across Coding, Math, and Agentic domains, in which safe trajectories are retained under a strict curation pipeline and unsafe trajectories are annotated at the step of their decisive error via consensus among multiple LLM judges. Built on that, we develop AgentForesight-7B, a compact online auditor trained with a coarse-to-fine reinforcement learning recipe that first equips it with a risk-anticipation prior at the failure boundary on adjacent safe/unsafe prefix pairs, then sharpens this prior into precise step-level localization under a three-axis reward jointly targeting the what, where, and who of an audit verdict. Across AFTraj-2K and an external Who\&When benchmark, AgentForesight-7B outperforms leading proprietary models, including GPT-4.1 and DeepSeek-V4-Pro, achieving up to +19.9% performance gain and 3times lower step localization error, opening the loop from post-hoc failures detection to enabling deployment-time intervention. Project page: https://zbox1005.github.io/agent-foresight/