Estamos prontos para um sistema de memória nativo do agente?
Are We Ready For An Agent-Native Memory System?
June 23, 2026
Autores: Wei Zhou, Xuanhe Zhou, Shaokun Han, Hongming Xu, Guoliang Li, Zhiyu Li, Feiyu Xiong, Fan Wu
cs.AI
Resumo
A memória para agentes baseados em grandes modelos de linguagem (LLMs) evoluiu rapidamente de simples mecanismos de recuperação aumentada para um sistema de gerenciamento de dados que suporta armazenamento persistente, recuperação, atualização, consolidação e governança dinâmica do ciclo de vida durante toda a execução do agente. Apesar dessa evolução, as avaliações existentes ainda avaliam a memória do agente principalmente por meio de métricas de sucesso de tarefa ponta a ponta (por exemplo, F1, BLEU), tratando o sistema subjacente como uma caixa preta monolítica. Consequentemente, preocupações críticas em nível de sistema, incluindo custos operacionais, trade-offs arquiteturais entre módulos de memória e robustez diante de atualizações dinâmicas de conhecimento, permanecem insuficientemente exploradas. Neste artigo, apresentamos um estudo experimental sistemático da memória de agentes sob uma perspectiva de gerenciamento de dados. Propomos um quadro analítico que decompõe a memória do agente em quatro módulos principais: representação e armazenamento, extração, recuperação e roteamento, e manutenção. Sob esse quadro, avaliamos 12 sistemas de memória representativos e duas linhas de base de referência em cinco cargas de trabalho de referência distribuídas por 11 conjuntos de dados. Nossa extensa avaliação ponta a ponta mostra que nenhuma arquitetura única domina em todos os cenários; em vez disso, a eficácia depende fortemente de quão bem a estrutura da memória se alinha ao gargalo da carga de trabalho. Além disso, por meio de estudos de ablação detalhados, quantificamos seus efeitos individuais na fidelidade da representação, precisão na recuperação, correção na atualização e estabilidade de longo horizonte. Por fim, revelamos trade-offs entre custo e desempenho em cargas de trabalho realistas, mostrando que a manutenção localizada é mais eficiente em termos de custo do que a reorganização global. Com base nesses achados, identificamos direções promissoras para a construção de sistemas de memória verdadeiramente nativos para agentes. O código está disponível publicamente em https://github.com/OpenDataBox/MemoryData.
English
Memory for large language model (LLM) agents has rapidly evolved from simple retrieval-augmented mechanisms into a data management system that supports persistent information storage, retrieval, update, consolidation, and dynamic lifecycle governance throughout agent execution. Despite this evolution, existing evaluations still benchmark agent memory mainly through end-to-end task success metrics (e.g., F1, BLEU), while treating the underlying system as a monolithic black box. As a result, critical system-level concerns, including operational costs, architectural trade-offs across memory modules, and robustness under dynamic knowledge updates, remain insufficiently explored. In this paper, we present a systematic experimental study of agent memory from a data management perspective. We propose an analytical framework that decomposes agent memory into four core modules: memory representation and storage, extraction, retrieval and routing, and maintenance. Under this framework, we evaluate 12 representative memory systems and two reference baselines across five benchmark workloads spanning 11 datasets. Our extensive end-to-end evaluation shows that no single architecture dominates across all scenarios; instead, effectiveness depends heavily on how well the memory structure aligns with the workload bottleneck. Furthermore, through fine-grained ablation studies, we quantify their individual effects on representation fidelity, retrieval precision, update correctness, and long-horizon stability. Finally, we reveal cost-performance trade-offs under realistic workloads, showing localized maintenance is more cost-efficient than global reorganization. Based on these findings, we identify promising directions towards building truly agent-native memory systems. The code is publicly available at https://github.com/OpenDataBox/MemoryData.