ChatPaper.aiChatPaper

MEME: Multi-entiteit & Evoluerende Geheugenevaluatie

MEME: Multi-entity & Evolving Memory Evaluation

May 12, 2026
Auteurs: Seokwon Jung, Alexander Rubinstein, Arnas Uselis, Sangdoo Yun, Seong Joon Oh
cs.AI

Samenvatting

Op LLM gebaseerde agenten opereren steeds vaker in persistente omgevingen waar zij informatie over meerdere sessies moeten opslaan, bijwerken en erover redeneren. Terwijl eerdere benchmarks alleen updates van enkele entiteiten evalueren, definieert MEME zes taken die de volledige ruimte beslaan zoals afgebakend door de multi-entiteit- en evoluerende assen, waaronder drie die niet door eerder werk werden gescoord: Cascade en Absence (afhankelijkheidsredenering) en Deletion (toestand na verwijdering). Bij het evalueren van zes geheugensystemen die drie geheugenparadigma's omvatten op 100 gecontroleerde episodes, vinden we dat alle systemen falen op afhankelijkheidsredenering onder de standaardconfiguratie (Cascade: 3%, Absence: 1% gemiddelde nauwkeurigheid), ondanks adequate statische ophaalprestaties. Promptoptimalisatie, diepere ophaling, verminderde vulruis en de meeste sterkere LLM's slagen er niet in deze kloof te dichten. Alleen een bestandsgebaseerde agent gekoppeld aan Claude Opus 4.7 als interne LLM dicht de kloof gedeeltelijk, maar tegen ~70x de baselinekosten, wat aangeeft dat het dichten momenteel afhankelijk is van configuraties die op schaal niet praktisch zijn. Code en data zijn beschikbaar op de projectpagina: https://seokwonjung-jay.github.io/meme-eval/.
English
LLM-based agents increasingly operate in persistent environments where they must store, update, and reason over information across many sessions. While prior benchmarks evaluate only single-entity updates, MEME defines six tasks spanning the full space defined by the multi-entity and evolving axes, including three not scored by prior work: Cascade and Absence (dependency reasoning) and Deletion (post-removal state). Evaluating six memory systems spanning three memory paradigms on 100 controlled episodes, we find that all systems collapse on dependency reasoning under the default configuration (Cascade: 3%, Absence: 1% in average accuracy) despite adequate static retrieval performance. Prompt optimization, deeper retrieval, reduced filler noise, and most stronger LLMs fail to close this gap. Only a file-based agent paired with Claude Opus 4.7 as its internal LLM partially closes the gap, but at ~70x the baseline cost, indicating closure currently depends on configurations that are not practical at scale. Code and data are available on the project page: https://seokwonjung-jay.github.io/meme-eval/.