ChatPaper.aiChatPaper

LongMemEval-V2: Evaluatie van langetermijnagentgeheugen ten opzichte van ervaren collega's

LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

May 12, 2026
Auteurs: Di Wu, Zixiang Ji, Asmi Kawatkar, Bryan Kwan, Jia-Chen Gu, Nanyun Peng, Kai-Wei Chang
cs.AI

Samenvatting

Langetermijngeheugen is van cruciaal belang voor agenten in gespecialiseerde webomgevingen, waar succes afhangt van het herinneren van interface-mogelijkheden, toestandsdynamiek, werkschema's en terugkerende faalwijzen. Bestaande geheugenbenchmarks voor agenten richten zich echter voornamelijk op gebruikersgeschiedenissen, korte sporen of downstream-taaksucces, waardoor de vraag open blijft hoe direct kan worden geëvalueerd of geheugensystemen omgevingsspecifieke ervaringen effectief internaliseren. Om deze leemte aan te pakken, introduceren we LongMemEval-V2 (LME-V2), een benchmark voor het evalueren of geheugensystemen agenten kunnen helpen de ervaring te verwerven die nodig is om deskundige collega's te worden in aangepaste omgevingen. LME-V2 bevat 451 handmatig samengestelde vragen die betrekking hebben op vijf kerngeheugenvaardigheden voor webagenten: statische toestandsherinnering, dynamische toestandsregistratie, werkstroomkennis, omgevingsvalkuilen en premissebewustzijn. Vragen worden gekoppeld aan geschiedenissporen die maximaal 500 sporen en 115M tokens bevatten. We gebruiken een contextverzamelingsformulering: geheugensystemen consumeren geschiedenissporen en leveren compacte bewijsstukken voor downstream-vraagbeantwoording. We stellen een reeks van twee geheugenmethoden voor: AgentRunbook-R, een efficiënt RAG-gebaseerd geheugen met kennispools voor ruwe toestandswaarnemingen, gebeurtenissen en strategienotities, en AgentRunbook-C, dat sporen als bestanden opslaat en een codeeragent oproept om bewijs te verzamelen in een uitgebreide sandbox. Experimenten tonen aan dat AgentRunbook-C de beste prestaties levert met een gemiddelde nauwkeurigheid van 72,5%, waarmee het de sterkste RAG-baseline (48,5%) en de kant-en-klare codeeragentbaseline (69,3%) overtreft. Ondanks de sterke prestatiewinst hebben methoden op basis van codeeragenten hoge latentiekosten. Hoewel AgentRunbook-C de Pareto-grens voor nauwkeurigheid-latentie verschuift, blijft er aanzienlijke ruimte voor verbetering. Samen vestigen deze resultaten LME-V2 als een uitdagende testomgeving voor het ontwikkelen van langetermijngeheugensystemen voor omgevingservaring.
English
Long-term memory is crucial for agents in specialized web environments, where success depends on recalling interface affordances, state dynamics, workflows, and recurring failure modes. However, existing memory benchmarks for agents mostly focus on user histories, short traces, or downstream task success, leaving open how to directly evaluate whether memory systems effectively internalize environment-specific experience. To address this gap, we introduce LongMemEval-V2 (LME-V2), a benchmark for evaluating whether memory systems can help agents acquire the experience needed to become knowledgeable colleagues in customized environments. LME-V2 contains 451 manually curated questions covering five core memory abilities for web agents: static state recall, dynamic state tracking, workflow knowledge, environment gotchas, and premise awareness. Questions are paired with history trajectories containing up to 500 trajectories and 115M tokens. We use a context gathering formulation: memory systems consume history trajectories and return compact evidence for downstream question answering. We propose a suite of two memory methods: AgentRunbook-R, an efficient RAG-based memory with knowledge pools for raw state observations, events, and strategy notes, and AgentRunbook-C, which stores trajectories as files and invokes a coding agent to gather evidence in an augmented sandbox. Experiments show that AgentRunbook-C achieves the best performance with 72.5% average accuracy, outperforming the strongest RAG baseline (48.5%) and the off-the-shelf coding agent baseline (69.3%). Despite the strong performance gains, coding agent based methods have high latency costs. While AgentRunbook-C advances the accuracy-latency Pareto frontier, substantial room for improvement remains. Together, these results establish LME-V2 as a challenging testbed for developing long-term memory systems for environment experience.