ChatPaper.aiChatPaper

LongMemEval-V2: Avaliação da Memória de Longo Prazo de Agentes em Relação a Colegas Experientes

LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

May 12, 2026
Autores: Di Wu, Zixiang Ji, Asmi Kawatkar, Bryan Kwan, Jia-Chen Gu, Nanyun Peng, Kai-Wei Chang
cs.AI

Resumo

A memória de longo prazo é crucial para agentes em ambientes web especializados, onde o sucesso depende da recordação de affordâncias da interface, dinâmicas de estado, fluxos de trabalho e modos de falha recorrentes. No entanto, os benchmarks existentes de memória para agentes focam principalmente em históricos de usuários, traces curtos ou sucesso em tarefas downstream, deixando em aberto como avaliar diretamente se sistemas de memória internalizam efetivamente a experiência específica do ambiente. Para preencher essa lacuna, introduzimos o LongMemEval-V2 (LME-V2), um benchmark para avaliar se sistemas de memória podem ajudar agentes a adquirir a experiência necessária para se tornarem colegas conhecedores em ambientes personalizados. O LME-V2 contém 451 questões curadas manualmente, abrangendo cinco habilidades centrais de memória para agentes web: recordação de estado estático, rastreamento de estado dinâmico, conhecimento de fluxo de trabalho, armadilhas do ambiente e consciência de premissas. As questões são pareadas com trajetórias históricas contendo até 500 trajetórias e 115 milhões de tokens. Utilizamos uma formulação de coleta de contexto: sistemas de memória consomem trajetórias históricas e retornam evidências compactas para responder a perguntas downstream. Propomos um conjunto de dois métodos de memória: AgentRunbook-R, uma memória eficiente baseada em RAG com pools de conhecimento para observações brutas de estado, eventos e notas estratégicas, e AgentRunbook-C, que armazena trajetórias como arquivos e invoca um agente de codificação para reunir evidências em uma sandbox aumentada. Experimentos mostram que o AgentRunbook-C alcança o melhor desempenho, com 72,5% de acurácia média, superando a linha de base RAG mais forte (48,5%) e a linha de base de agente de codificação pré-fabricada (69,3%). Apesar dos fortes ganhos de desempenho, métodos baseados em agente de codificação apresentam altos custos de latência. Embora o AgentRunbook-C avance a fronteira de Pareto entre acurácia e latência, ainda há espaço substancial para melhoria. Em conjunto, esses resultados estabelecem o LME-V2 como um campo de testes desafiador para o desenvolvimento de sistemas de memória de longo prazo para experiência ambiental.
English
Long-term memory is crucial for agents in specialized web environments, where success depends on recalling interface affordances, state dynamics, workflows, and recurring failure modes. However, existing memory benchmarks for agents mostly focus on user histories, short traces, or downstream task success, leaving open how to directly evaluate whether memory systems effectively internalize environment-specific experience. To address this gap, we introduce LongMemEval-V2 (LME-V2), a benchmark for evaluating whether memory systems can help agents acquire the experience needed to become knowledgeable colleagues in customized environments. LME-V2 contains 451 manually curated questions covering five core memory abilities for web agents: static state recall, dynamic state tracking, workflow knowledge, environment gotchas, and premise awareness. Questions are paired with history trajectories containing up to 500 trajectories and 115M tokens. We use a context gathering formulation: memory systems consume history trajectories and return compact evidence for downstream question answering. We propose a suite of two memory methods: AgentRunbook-R, an efficient RAG-based memory with knowledge pools for raw state observations, events, and strategy notes, and AgentRunbook-C, which stores trajectories as files and invokes a coding agent to gather evidence in an augmented sandbox. Experiments show that AgentRunbook-C achieves the best performance with 72.5% average accuracy, outperforming the strongest RAG baseline (48.5%) and the off-the-shelf coding agent baseline (69.3%). Despite the strong performance gains, coding agent based methods have high latency costs. While AgentRunbook-C advances the accuracy-latency Pareto frontier, substantial room for improvement remains. Together, these results establish LME-V2 as a challenging testbed for developing long-term memory systems for environment experience.