GateMem: Benchmarking da Governança de Memória em Agentes de Memória Compartilhada com Múltiplos Principais
GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents
June 17, 2026
Autores: Zhe Ren, Yibo Yang, Yimeng Chen, Zijun Zhao, Benshuo Fu, Zhihao Shu, Bingjie Zhang, Yangyang Xu, Dandan Guo, Shuicheng Yan
cs.AI
Resumo
Benchmarks de memória para agentes LLM assumem em grande parte cenários de usuário único, deixando assistentes compartilhados para hospitais, locais de trabalho, campi e residências subestudados. Nessas implantações, múltiplos principais escrevem em um pool de memória comum e o consultam sob diferentes papéis, escopos e relacionamentos; portanto, a qualidade da memória exige tanto governança quanto recuperação. Apresentamos o GateMem, um benchmark para agentes de memória compartilhada multi-principal. O GateMem avalia conjuntamente a utilidade para solicitações legítimas de longo horizonte com atualizações de estado, controle de acesso através de limites de autorização contextuais e esquecimento ativo orientado ao agente após solicitações explícitas de exclusão. Ele abrange domínios médico, corporativo, educacional e residencial, com episódios longos de múltiplos participantes, injeção incremental de memória, pontos de verificação ocultos, julgamento estruturado e anotações de alvos de vazamento. Através de diversas linhas de base e modelos backbone, nenhum método alcança simultaneamente alta utilidade, controle de acesso robusto e esquecimento confiável. O prompting de contexto longo frequentemente produz a melhor pontuação de governança a um alto custo de tokens, enquanto métodos baseados em recuperação e memória externa reduzem o custo, mas ainda vazam informações não autorizadas ou excluídas. Esses resultados mostram que os agentes de memória atuais ainda estão longe de uma implantação institucional compartilhada confiável.
English
Memory benchmarks for LLM agents largely assume single-user settings, leaving shared assistants for hospitals, workplaces, campuses, and households understudied. In these deployments, multiple principals write to a common memory pool and query it under different roles, scopes, and relationships, so memory quality requires governance as well as recall. We introduce GateMem, a benchmark for multi-principal shared-memory agents. GateMem jointly evaluates utility for legitimate long-horizon requests with state updates, access control across contextual authorization boundaries, and agent-facing active forgetting after explicit deletion requests. It spans medical, office, education, and household domains, with long-form multi-party episodes, incremental memory injection, hidden checkpoints, structured judging, and leak-target annotations. Across diverse baselines and backbone models, no method simultaneously achieves strong utility, robust access control, and reliable forgetting. Long-context prompting often yields the best governance score at high token cost, while retrieval-based and external-memory methods reduce cost yet still leak unauthorized or deleted information. These results show current memory agents remain far from reliable shared institutional deployment.