ChatPaper.aiChatPaper

Où les agents de recherche approfondie font-ils erreur ? Localisation des erreurs au niveau des segments dans les trajectoires des agents

Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

June 1, 2026
Auteurs: Jiaming Wang, Ziteng Feng, Jiangtao Wu, Ruihao Li, Qianqian Xie, Yuxiang Ren, He Zhu, Xueming Han, Fanyu Meng, Junlan Feng, Jiaheng Liu
cs.AI

Résumé

Les agents de recherche approfondie accomplissent des tâches via de longues trajectoires de recherche, d'utilisation d'outils, d'inspection de preuves et de synthèse de réponses. L'évaluation basée sur les réponses finales indique si un agent réussit, mais pas quelles parties de la trajectoire rendent la réponse peu fiable. Nous étudions la localisation des erreurs au niveau des segments pour les agents de recherche approfondie. Nous collectons 2 790 trajectoires réelles provenant de deux cadres d'agents, trois modèles de base et trois benchmarks, convertissons les journaux bruts en segments sémantiques, et annotons les segments d'erreur nuisibles via une révision experte assistée par LLM. À partir de ces annotations, nous construisons TELBench, un benchmark de 1 000 instances pour identifier les segments d'erreur parmi l'exploration normale, les recherches échouées, les hypothèses provisoires et le bruit inoffensif. Nous proposons également DRIFT, un cadre d'audit centré sur les affirmations qui suit les affirmations de l'agent, vérifie leur soutien dans les preuves de la trajectoire, et marque les segments où des affirmations non étayées ou contradictoires affectent le chemin de réponse. Des expériences menées sur des familles de modèles et des cadres d'audit montrent que DRIFT améliore la localisation des erreurs au niveau des segments et la précision de la première erreur jusqu'à 30 points de pourcentage. Notre travail offre une vue au niveau du processus de la fiabilité dans les agents de recherche approfondie.
English
Deep-research agents solve tasks through long trajectories of search, tool use, evidence inspection, and answer synthesis. Evaluation based on final answers shows whether an agent succeeds, but not which parts of the trajectory make the answer unreliable. We study span-level error localization for deep-research agents. We collect 2,790 real trajectories from two agent frameworks, three backbone models, and three benchmarks, convert raw logs into semantic spans, and annotate harmful error spans through LLM-assisted expert review. From these annotations, we build TELBench, a 1,000-instance benchmark for identifying error spans among normal exploration, failed searches, tentative hypotheses, and harmless noise. We further propose DRIFT, a claim-centric auditing framework that tracks agent claims, checks their support in trajectory evidence, and marks spans where unsupported or conflicting claims affect the answer path. Experiments across model families and auditing frameworks show that DRIFT improves span-level error localization and first-error accuracy by up to 30 percentage points. Our work provides a process-level view of reliability in deep-research agents.