ChatPaper.aiChatPaper

Escapando da Armadilha da Autoconfirmação: Um Paradigma de Executar-Destilar-Verificar para Aprendizagem por Experiência Agêntica

Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning

June 23, 2026
Autores: Shiding Zhu, Yudi Qi, Yajie Wang, Jiaze Li, Chao Song, Yaorui Shi, Yibo Miao, Hanqi Gao, Kai Zhang
cs.AI

Resumo

A auto-evolução orientada pela experiência é crucial para que agentes de grandes modelos de linguagem (LLMs) melhorem por meio da interação em mundo aberto. No entanto, os métodos existentes de aprendizado por experiência dependem majoritariamente de loops de agente único, onde o mesmo agente executa tarefas, resume resultados e determina o conteúdo da memória. Essa configuração torna os agentes vulneráveis à Armadilha da Autoconfirmação: trajetórias incorretas, mas autoconsistentes, são erroneamente identificadas como experiências bem-sucedidas, levando a erros cumulativos durante a recuperação e reutilização. Para lidar com esse problema, propomos o EDV, uma estrutura Executar-Destilar-Verificar para aprendizado confiável de experiência. Na fase Executar, múltiplos agentes heterogêneos exploram o mesmo espaço de tarefas em paralelo para gerar diversas trajetórias candidatas. Na fase Destilar, um agente terceirizado dedicado analisa comparativamente essas trajetórias para produzir experiências candidatas, reduzindo o viés de sumarização centrado no executor. Na fase Verificar, o grupo de execução valida os candidatos por meio de um mecanismo de consenso, e apenas as experiências aprovadas são gravadas na memória compartilhada ou privada. Ao desacoplar as três fases, o EDV transforma o aprendizado por experiência de uma autorreflexão isolada em uma construção colaborativa, filtrando conteúdo errôneo e ruidoso antes da inserção na memória. Avaliamos o EDV em três benchmarks desafiadores de horizonte longo: tau2-bench, Mind2Web e MMTB. Os resultados mostram que o EDV supera consistentemente baselines robustos, validando que a construção confiável de experiência é essencial para a auto-evolução robusta de agentes. Nosso código está disponível em https://github.com/shidingz/EDV.
English
Experience-driven self-evolution is critical for large language model (LLM) agents to improve through open-world interaction. However, existing experience learning methods mostly rely on single-agent loops, where the same agent executes tasks, summarizes outcomes, and determines memory content. This setup makes agents vulnerable to the Self-Confirmation Trap: wrong-but-self-consistent trajectories are misidentified as successful experience, leading to cumulative errors during retrieval and reuse. To address this issue, we propose EDV, an Execute-Distill-Verify framework for reliable experience learning. In the Execute stage, multiple heterogeneous agents explore the same task space in parallel to generate diverse candidate trajectories. In the Distill stage, a dedicated third-party agent comparatively analyzes these trajectories to produce candidate experiences, reducing executor-centric summarization bias. In the Verify stage, the execution group validates candidates via a consensus mechanism, and only approved experiences are written into shared or private memory. By decoupling the three stages, EDV transforms experience learning from isolated self-reflection into collaborative construction, filtering erroneous and noisy content before memory insertion. We evaluate EDV on three challenging long-horizon benchmarks: tau2-bench, Mind2Web and MMTB. Results show EDV consistently outperforms strong baselines, validating that reliable experience construction is essential for robust agent self-evolution. Our code is available at https://github.com/shidingz/EDV.