ChatPaper.aiChatPaper

Tracer l'échec agentif à partir du flux de succès

Tracing Agentic Failure from the Flow of Success

July 14, 2026
Auteurs: Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li
cs.AI

Résumé

L'attribution des échecs dans les systèmes agentiels basés sur des LLM, c'est-à-dire l'identification des étapes d'une trajectoire d'échec qui ont causé l'échec de la tâche, est essentielle pour le débogage et l'amélioration de ces systèmes. Les approches existantes reposent soit sur des pipelines basés sur le prompting, qui sont coûteux en calcul, soit sur un post-entraînement sur des trajectoires d'échec avec des annotations d'erreur au niveau de l'étape, dont la collecte est coûteuse et la mise à l'échelle difficile. Nous soutenons qu'un modèle pratique d'attribution des échecs doit être léger et entraînable sans supervision au niveau de l'étape sur des données d'échec. Pour cela, nous abordons l'attribution non supervisée des échecs, c'est-à-dire l'entraînement exclusivement sur des trajectoires réussies et l'identification des étapes d'erreur au moment de l'inférence sur une trajectoire d'échec. Nous proposons OAT, qui formule ce problème comme un apprentissage à une classe avec des équations différentielles contrôlées neuronales, modélisant le motif dynamique des trajectoires réussies dans l'espace latent. Lors de l'inférence, chaque étape d'une trajectoire d'échec se voit attribuer un score d'anomalie basé sur sa déviation par rapport à la dynamique apprise sur les trajectoires réussies, lequel est ensuite utilisé pour former un ensemble d'étapes d'erreur. Avec un entraînement sur seulement 100 trajectoires réussies, les expériences montrent qu'OAT est 200 à 5000 fois plus rapide que les bases de référence basées sur le prompting et, en même temps, les surpasse systématiquement sur des ensembles de données à la fois intra-domaine et hors distribution, avec des scores F1 respectifs de +20 % et +7 %, démontrant qu'OAT constitue une direction prometteuse et efficace pour diagnostiquer les échecs des systèmes agentiels.
English
Failure attribution for LLM-based agentic systems, i.e., identifying which steps in a failure trajectory caused the task to fail, is critical for debugging and improving these systems. Existing approaches either rely on prompting-based pipelines, which are computationally expensive, or require post-training on failure trajectories with step-level error annotations, which are costly to collect and difficult to scale. We argue that a practical failure attribution model should be lightweight and trainable without step-level supervision on failure data. To this end, we address unsupervised failure attribution, i.e., training exclusively on successful trajectories and identifying error steps at inference time given a failure trajectory. We propose OAT, which casts this problem as one-class learning with neural controlled differential equations, modeling the dynamical pattern of successful trajectories in latent space. At inference time, each step in a failure trajectory is assigned an anomaly score based on its deviation from the dynamics learned on successful trajectories, which is then used to form a set of error steps. With training on only 100 successful trajectories, experiments show that OAT is 200--5000 times faster than prompting-based baselines, and, at the same time, consistently outperforms them in both in-domain and out-of-distribution datasets with +20% and +7% F1 scores, respectively, demonstrating that OAT is a promising and efficient direction for diagnosing agentic system failures.