ChatPaper.aiChatPaper

MEME: Avaliação de Memória Multi-entidade e Evolutiva

MEME: Multi-entity & Evolving Memory Evaluation

May 12, 2026
Autores: Seokwon Jung, Alexander Rubinstein, Arnas Uselis, Sangdoo Yun, Seong Joon Oh
cs.AI

Resumo

Agentes baseados em LLMs operam cada vez mais em ambientes persistentes, onde precisam armazenar, atualizar e raciocinar sobre informações ao longo de múltiplas sessões. Enquanto benchmarks anteriores avaliam apenas atualizações de entidades únicas, o MEME define seis tarefas que abrangem todo o espaço definido pelos eixos de múltiplas entidades e evolução, incluindo três não avaliadas por trabalhos anteriores: Cascata e Ausência (raciocínio de dependência) e Exclusão (estado pós-remoção). Avaliando seis sistemas de memória, abrangendo três paradigmas de memória, em 100 episódios controlados, constatamos que todos os sistemas colapsam no raciocínio de dependência sob a configuração padrão (Cascata: 3%, Ausência: 1% em acurácia média), apesar do desempenho adequado em recuperação estática. Otimização de prompt, recuperação mais profunda, redução de ruído de preenchimento e a maioria dos LLMs mais fortes não conseguem eliminar essa lacuna. Apenas um agente baseado em arquivos, emparelhado com Claude Opus 4.7 como seu LLM interno, elimina parcialmente a lacuna, mas a um custo ~70 vezes maior que o da linha de base, indicando que a eliminação depende atualmente de configurações que não são práticas em escala. Código e dados estão disponíveis na página do projeto: https://seokwonjung-jay.github.io/meme-eval/.
English
LLM-based agents increasingly operate in persistent environments where they must store, update, and reason over information across many sessions. While prior benchmarks evaluate only single-entity updates, MEME defines six tasks spanning the full space defined by the multi-entity and evolving axes, including three not scored by prior work: Cascade and Absence (dependency reasoning) and Deletion (post-removal state). Evaluating six memory systems spanning three memory paradigms on 100 controlled episodes, we find that all systems collapse on dependency reasoning under the default configuration (Cascade: 3%, Absence: 1% in average accuracy) despite adequate static retrieval performance. Prompt optimization, deeper retrieval, reduced filler noise, and most stronger LLMs fail to close this gap. Only a file-based agent paired with Claude Opus 4.7 as its internal LLM partially closes the gap, but at ~70x the baseline cost, indicating closure currently depends on configurations that are not practical at scale. Code and data are available on the project page: https://seokwonjung-jay.github.io/meme-eval/.