Отслеживание агентного сбоя в потоке успеха
Tracing Agentic Failure from the Flow of Success
July 14, 2026
Авторы: Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li
cs.AI
Аннотация
Атрибуция сбоев для агентных систем на основе LLM, то есть определение того, какие шаги в траектории сбоя привели к неудаче задачи, имеет решающее значение для отладки и улучшения этих систем. Существующие подходы либо полагаются на конвейеры на основе подсказок (промптов), что требует больших вычислительных затрат, либо требуют дополнительного обучения на траекториях сбоев с аннотациями ошибок на уровне шагов, что дорого в сборе и трудно масштабируемо. Мы утверждаем, что практическая модель атрибуции сбоев должна быть легковесной и обучаемой без супервизии уровня шагов на данных о сбоях. С этой целью мы рассматриваем неконтролируемую атрибуцию сбоев, то есть обучение исключительно на успешных траекториях и идентификацию шагов с ошибками во время инференса при наличии траектории сбоя. Мы предлагаем OAT, которая формулирует эту задачу как обучение с одним классом с использованием нейронных управляемых дифференциальных уравнений, моделируя динамический паттерн успешных траекторий в латентном пространстве. Во время инференса каждому шагу в траектории сбоя присваивается оценка аномальности на основе его отклонения от динамики, изученной на успешных траекториях, которая затем используется для формирования набора шагов с ошибками. При обучении всего на 100 успешных траекториях эксперименты показывают, что OAT в 200–5000 раз быстрее базовых методов на основе подсказок и при этом стабильно превосходит их как на наборах данных из того же распределения (in-domain), так и на наборах из другого распределения (out-of-distribution), с приростом F1-меры на +20% и +7% соответственно, демонстрируя, что OAT является перспективным и эффективным направлением для диагностики сбоев агентных систем.
English
Failure attribution for LLM-based agentic systems, i.e., identifying which steps in a failure trajectory caused the task to fail, is critical for debugging and improving these systems. Existing approaches either rely on prompting-based pipelines, which are computationally expensive, or require post-training on failure trajectories with step-level error annotations, which are costly to collect and difficult to scale. We argue that a practical failure attribution model should be lightweight and trainable without step-level supervision on failure data. To this end, we address unsupervised failure attribution, i.e., training exclusively on successful trajectories and identifying error steps at inference time given a failure trajectory. We propose OAT, which casts this problem as one-class learning with neural controlled differential equations, modeling the dynamical pattern of successful trajectories in latent space. At inference time, each step in a failure trajectory is assigned an anomaly score based on its deviation from the dynamics learned on successful trajectories, which is then used to form a set of error steps. With training on only 100 successful trajectories, experiments show that OAT is 200--5000 times faster than prompting-based baselines, and, at the same time, consistently outperforms them in both in-domain and out-of-distribution datasets with +20% and +7% F1 scores, respectively, demonstrating that OAT is a promising and efficient direction for diagnosing agentic system failures.