Rastreando o Fracasso Agencial a partir do Fluxo do Sucesso
Tracing Agentic Failure from the Flow of Success
July 14, 2026
Autores: Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li
cs.AI
Resumo
A atribuição de falhas em sistemas agentivos baseados em LLM, ou seja, identificar quais etapas em uma trajetória de falha causaram o fracasso da tarefa, é fundamental para depurar e melhorar esses sistemas. As abordagens existentes dependem de pipelines baseados em prompt, que são computacionalmente caros, ou exigem pós-treinamento em trajetórias de falha com anotações de erro em nível de etapa, que são caras de coletar e difíceis de escalar. Argumentamos que um modelo prático de atribuição de falhas deve ser leve e treinável sem supervisão em nível de etapa sobre dados de falha. Para isso, abordamos a atribuição não supervisionada de falhas, ou seja, treinamento exclusivamente em trajetórias bem-sucedidas e identificação de etapas de erro no momento da inferência, dada uma trajetória de falha. Propomos o OAT, que trata esse problema como aprendizado de uma classe com equações diferenciais controladas neurais, modelando o padrão dinâmico de trajetórias bem-sucedidas no espaço latente. No momento da inferência, cada etapa em uma trajetória de falha recebe uma pontuação de anomalia com base em seu desvio da dinâmica aprendida em trajetórias bem-sucedidas, que é então usada para formar um conjunto de etapas de erro. Com treinamento em apenas 100 trajetórias bem-sucedidas, experimentos mostram que o OAT é 200 a 5000 vezes mais rápido que as linhas de base baseadas em prompt e, ao mesmo tempo, supera-as consistentemente em conjuntos de dados dentro do domínio e fora da distribuição, com pontuações F1 de +20% e +7%, respectivamente, demonstrando que o OAT é uma direção promissora e eficiente para diagnosticar falhas em sistemas agentivos.
English
Failure attribution for LLM-based agentic systems, i.e., identifying which steps in a failure trajectory caused the task to fail, is critical for debugging and improving these systems. Existing approaches either rely on prompting-based pipelines, which are computationally expensive, or require post-training on failure trajectories with step-level error annotations, which are costly to collect and difficult to scale. We argue that a practical failure attribution model should be lightweight and trainable without step-level supervision on failure data. To this end, we address unsupervised failure attribution, i.e., training exclusively on successful trajectories and identifying error steps at inference time given a failure trajectory. We propose OAT, which casts this problem as one-class learning with neural controlled differential equations, modeling the dynamical pattern of successful trajectories in latent space. At inference time, each step in a failure trajectory is assigned an anomaly score based on its deviation from the dynamics learned on successful trajectories, which is then used to form a set of error steps. With training on only 100 successful trajectories, experiments show that OAT is 200--5000 times faster than prompting-based baselines, and, at the same time, consistently outperforms them in both in-domain and out-of-distribution datasets with +20% and +7% F1 scores, respectively, demonstrating that OAT is a promising and efficient direction for diagnosing agentic system failures.