ChatPaper.aiChatPaper

Échapper au piège d’auto-confirmation : un paradigme Exécuter-Distiller-Vérifier pour l’apprentissage par expérience agentique

Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning

June 23, 2026
Auteurs: Shiding Zhu, Yudi Qi, Yajie Wang, Jiaze Li, Chao Song, Yaorui Shi, Yibo Miao, Hanqi Gao, Kai Zhang
cs.AI

Résumé

L'auto-évolution guidée par l'expérience est cruciale pour que les agents basés sur de grands modèles de langage (LLM) s'améliorent grâce à une interaction en monde ouvert. Cependant, les méthodes existantes d'apprentissage par l'expérience reposent principalement sur des boucles à agent unique, où le même agent exécute les tâches, résume les résultats et détermine le contenu de la mémoire. Cette configuration rend les agents vulnérables au piège de l'auto-confirmation : des trajectoires erronées mais auto-cohérentes sont identifiées à tort comme des expériences réussies, ce qui entraîne des erreurs cumulatives lors de la récupération et de la réutilisation. Pour résoudre ce problème, nous proposons EDV, un cadre d'Exécution-Distillation-Vérification pour un apprentissage fiable de l'expérience. Dans l'étape d'exécution, plusieurs agents hétérogènes explorent le même espace de tâches en parallèle pour générer des trajectoires candidates diverses. Dans l'étape de distillation, un agent tiers dédié analyse comparativement ces trajectoires afin de produire des expériences candidates, réduisant ainsi le biais de résumé centré sur l'exécuteur. Dans l'étape de vérification, le groupe d'exécution valide les candidates via un mécanisme de consensus, et seules les expériences approuvées sont écrites dans la mémoire partagée ou privée. En découplant les trois étapes, EDV transforme l'apprentissage de l'expérience d'une auto-réflexion isolée en une construction collaborative, filtrant le contenu erroné et bruité avant l'insertion en mémoire. Nous évaluons EDV sur trois benchmarks exigeants à long horizon : tau2-bench, Mind2Web et MMTB. Les résultats montrent qu'EDV surpasse systématiquement des références solides, validant que la construction fiable de l'expérience est essentielle pour une auto-évolution robuste des agents. Notre code est disponible à l'adresse https://github.com/shidingz/EDV.
English
Experience-driven self-evolution is critical for large language model (LLM) agents to improve through open-world interaction. However, existing experience learning methods mostly rely on single-agent loops, where the same agent executes tasks, summarizes outcomes, and determines memory content. This setup makes agents vulnerable to the Self-Confirmation Trap: wrong-but-self-consistent trajectories are misidentified as successful experience, leading to cumulative errors during retrieval and reuse. To address this issue, we propose EDV, an Execute-Distill-Verify framework for reliable experience learning. In the Execute stage, multiple heterogeneous agents explore the same task space in parallel to generate diverse candidate trajectories. In the Distill stage, a dedicated third-party agent comparatively analyzes these trajectories to produce candidate experiences, reducing executor-centric summarization bias. In the Verify stage, the execution group validates candidates via a consensus mechanism, and only approved experiences are written into shared or private memory. By decoupling the three stages, EDV transforms experience learning from isolated self-reflection into collaborative construction, filtering erroneous and noisy content before memory insertion. We evaluate EDV on three challenging long-horizon benchmarks: tau2-bench, Mind2Web and MMTB. Results show EDV consistently outperforms strong baselines, validating that reliable experience construction is essential for robust agent self-evolution. Our code is available at https://github.com/shidingz/EDV.