ChatPaper.aiChatPaper

Nuttige herinneringen worden foutief wanneer ze continu worden bijgewerkt door LLM's

Useful Memories Become Faulty When Continuously Updated by LLMs

May 13, 2026
Auteurs: Dylan Zhang, Yanshan Lin, Zhengkun Wu, Yihang Sun, Bingxuan Li, Dianqi Li, Hao Peng
cs.AI

Samenvatting

Leren van ervaringen uit het verleden profiteert van twee complementaire vormen van geheugen: episodische sporen — ruwe trajecten van wat er gebeurde — en geconsolideerde abstracties die over vele episodes heen worden gedistilleerd tot herbruikbare, schema-achtige lessen. Recente agent-gebaseerde geheugensystemen streven naar de geconsolideerde vorm: een LLM herschrijft eerdere trajecten naar een tekstuele geheugenbank die het continu bijwerkt met nieuwe interacties, wat zelfverbeterende agenten belooft zonder parameterupdates. Toch ontdekken we dat dergelijke geconsolideerde herinneringen die door de huidige LLM's worden geproduceerd vaak foutief zijn, zelfs wanneer ze zijn afgeleid van bruikbare ervaringen. Naarmate de consolidatie vordert, stijgt het geheugennut eerst, daarna neemt het af en kan het onder de geheugenloze basislijn zakken. Verrassenderwijs faalt GPT-5.4, zelfs bij consolidatie op basis van grondwaarheidsoplossingen, in 54% van een set ARC-AGI-problemen die het eerder zonder geheugen had opgelost. We herleiden de achteruitgang tot de consolidatiestap in plaats van de onderliggende ervaring: dezelfde trajecten leiden onder verschillende bijwerkingsschema's tot kwalitatief andere herinneringen, en een alleen-episodische controle die deze trajecten simpelweg behoudt, blijft concurrerend met de consolidatie-modellen die we testen. In een gecontroleerde ARC-AGI Stream-omgeving die Retain-, Delete- en Consolidate-acties blootstelt, bewaren agenten standaard ruwe episodes en verdubbelen ze de nauwkeurigheid van hun geforceerde consolidatie-tegenhangers; het volledig uitschakelen van consolidatie (alleen episodisch beheer) evenaart dit automatische regime. In de praktijk moet robuust agentgeheugen ruwe episodes als eersteklas bewijs behandelen en consolidatie expliciet afschermen in plaats van het na elke interactie te activeren. Vooruitkijkend zal betrouwbaar agentgeheugen LLM's vereisen die kunnen consolideren zonder het bewijs waarop ze vertrouwen te overschrijven.
English
Learning from past experience benefits from two complementary forms of memory: episodic traces -- raw trajectories of what happened -- and consolidated abstractions distilled across many episodes into reusable, schema-like lessons. Recent agentic-memory systems pursue the consolidated form: an LLM rewrites past trajectories into a textual memory bank that it continuously updates with new interactions, promising self-improving agents without parameter updates. Yet we find that such consolidated memories produced by today's LLMs are often faulty even when derived from useful experiences. As consolidation proceeds, memory utility first rises, then degrades, and can fall below the no-memory baseline. More surprisingly, even when consolidating from ground-truth solutions, GPT-5.4 fails on 54% of a set of ARC-AGI problems it had previously solved without memory. We trace the regression to the consolidation step rather than the underlying experience: the same trajectories yield qualitatively different memories under different update schedules, and an episodic-only control that simply retains those trajectories remains competitive with the consolidators we test. In a controlled ARC-AGI Stream environment that exposes Retain, Delete, and Consolidate actions, agents preserve raw episodes by default and double the accuracy of their forced-consolidation counterparts; disabling consolidation entirely (episodic management only) matches this auto regime. Practically, robust agent memory should treat raw episodes as first-class evidence and gate consolidation explicitly rather than firing it after every interaction. Looking forward, reliable agentic memory will require LLMs that can consolidate without overwriting the evidence they depend on.