ChatPaper.aiChatPaper

Trazando el fracaso agentivo a partir del flujo del éxito

Tracing Agentic Failure from the Flow of Success

July 14, 2026
Autores: Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li
cs.AI

Resumen

La atribución de fallos en sistemas agentivos basados en LLM, es decir, identificar qué pasos en una trayectoria de fallo provocaron el fracaso de la tarea, es fundamental para depurar y mejorar estos sistemas. Los enfoques existentes se basan en pipelines basados en indicaciones, que son computacionalmente costosos, o requieren un post-entrenamiento en trayectorias de fallo con anotaciones de errores a nivel de paso, cuya recolección es costosa y difícil de escalar. Argumentamos que un modelo práctico de atribución de fallos debe ser ligero y entrenable sin supervisión a nivel de paso sobre datos de fallo. Con este fin, abordamos la atribución de fallos no supervisada, es decir, entrenando exclusivamente en trayectorias exitosas e identificando pasos de error en tiempo de inferencia dada una trayectoria de fallo. Proponemos OAT, que plantea este problema como aprendizaje de una clase con ecuaciones diferenciales controladas neuronales, modelando el patrón dinámico de las trayectorias exitosas en el espacio latente. En tiempo de inferencia, a cada paso en una trayectoria de fallo se le asigna una puntuación de anomalía basada en su desviación de la dinámica aprendida en trayectorias exitosas, que luego se utiliza para formar un conjunto de pasos de error. Con entrenamiento en solo 100 trayectorias exitosas, los experimentos muestran que OAT es de 200 a 5000 veces más rápido que las líneas base basadas en indicaciones y, al mismo tiempo, las supera consistentemente tanto en conjuntos de datos intra-dominio como fuera de distribución, con puntuaciones F1 de +20% y +7% respectivamente, lo que demuestra que OAT es una dirección prometedora y eficiente para diagnosticar fallos en sistemas agentivos.
English
Failure attribution for LLM-based agentic systems, i.e., identifying which steps in a failure trajectory caused the task to fail, is critical for debugging and improving these systems. Existing approaches either rely on prompting-based pipelines, which are computationally expensive, or require post-training on failure trajectories with step-level error annotations, which are costly to collect and difficult to scale. We argue that a practical failure attribution model should be lightweight and trainable without step-level supervision on failure data. To this end, we address unsupervised failure attribution, i.e., training exclusively on successful trajectories and identifying error steps at inference time given a failure trajectory. We propose OAT, which casts this problem as one-class learning with neural controlled differential equations, modeling the dynamical pattern of successful trajectories in latent space. At inference time, each step in a failure trajectory is assigned an anomaly score based on its deviation from the dynamics learned on successful trajectories, which is then used to form a set of error steps. With training on only 100 successful trajectories, experiments show that OAT is 200--5000 times faster than prompting-based baselines, and, at the same time, consistently outperforms them in both in-domain and out-of-distribution datasets with +20% and +7% F1 scores, respectively, demonstrating that OAT is a promising and efficient direction for diagnosing agentic system failures.