AgentForesight : Audit en ligne pour la prédiction précoce de défaillance dans les systèmes multi-agents
AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems
May 9, 2026
Auteurs: Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang
cs.AI
Résumé
Les systèmes multi-agents basés sur des LLM sont de plus en plus déployés sur des tâches à long horizon, mais une seule erreur décisive est souvent acceptée par les agents en aval et se propage en un échec au niveau de la trajectoire. Les travaux existants cadrent ce problème comme une attribution post-hoc des échecs, diagnostiquant l'agent responsable et l'étape après la fin de la trajectoire. Cependant, ce paradigme renonce à toute possibilité d'intervention pendant que la trajectoire est encore en cours. Dans ce travail, nous présentons AgentForesight, un cadre qui reformule ce problème comme un audit en ligne : à chaque étape d'une trajectoire en cours, un auditeur observe uniquement le préfixe actuel et doit soit continuer l'exécution, soit alarmer à la première erreur décisive, sans accès aux étapes futures. Pour cela, nous constituons AFTraj-2K, un corpus de trajectoires agentiques couvrant les domaines du Codage, des Mathématiques et des Systèmes agentiques, dans lequel les trajectoires sûres sont conservées sous un pipeline de curation strict et les trajectoires non sûres sont annotées à l'étape de leur erreur décisive via un consensus entre plusieurs juges LLM. Sur cette base, nous développons AgentForesight-7B, un auditeur en ligne compact entraîné avec une recette d'apprentissage par renforcement du grossier au fin qui l'équipe d'abord d'un a priori d'anticipation des risques à la frontière d'échec sur des paires adjacentes de préfixes sûrs/non sûrs, puis affine cet a priori en une localisation précise au niveau de l'étape sous une récompense sur trois axes ciblant conjointement le quoi, le où et le qui d'un verdict d'audit. Sur AFTraj-2K et un benchmark externe Who\&When, AgentForesight-7B surpasse les modèles propriétaires de premier plan, y compris GPT-4.1 et DeepSeek-V4-Pro, atteignant jusqu'à +19,9% de gain de performance et une erreur de localisation d'étape 3 fois plus faible, ouvrant la boucle de la détection post-hoc des échecs à l'intervention au moment du déploiement. Page du projet : https://zbox1005.github.io/agent-foresight/
English
LLM-based multi-agent systems are increasingly deployed on long-horizon tasks, but a single decisive error is often accepted by downstream agents and cascades into trajectory-level failure. Existing work frames this as post-hoc failure attribution, diagnosing the responsible agent and step after the trajectory has ended. However, this paradigm forfeits any opportunity to intervene while trajectory is still unfolding. In this work, we introduce AgentForesight, a framework that reframes this problem as online auditing: at each step of an unfolding trajectory, an auditor observes only the current prefix and must either continue the run or alarm at the earliest decisive error, without access to future steps. To this end, we curate AFTraj-2K, a corpus of agentic trajectories across Coding, Math, and Agentic domains, in which safe trajectories are retained under a strict curation pipeline and unsafe trajectories are annotated at the step of their decisive error via consensus among multiple LLM judges. Built on that, we develop AgentForesight-7B, a compact online auditor trained with a coarse-to-fine reinforcement learning recipe that first equips it with a risk-anticipation prior at the failure boundary on adjacent safe/unsafe prefix pairs, then sharpens this prior into precise step-level localization under a three-axis reward jointly targeting the what, where, and who of an audit verdict. Across AFTraj-2K and an external Who\&When benchmark, AgentForesight-7B outperforms leading proprietary models, including GPT-4.1 and DeepSeek-V4-Pro, achieving up to +19.9% performance gain and 3times lower step localization error, opening the loop from post-hoc failures detection to enabling deployment-time intervention. Project page: https://zbox1005.github.io/agent-foresight/