δ-mem: Efficiënt Online Geheugen voor Grote Taalmodellen
δ-mem: Efficient Online Memory for Large Language Models
May 12, 2026
Auteurs: Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria
cs.AI
Samenvatting
Grote taalmodellen hebben steeds vaker behoefte aan het accumuleren en hergebruiken van historische informatie in langetermijnassistenten en agentsystemen. Het simpelweg uitbreiden van het contextvenster is kostbaar en zorgt vaak niet voor een effectief gebruik van de context. Wij stellen δ-mem voor, een lichtgewicht geheugenmechanisme dat een bevroren full-attention backbone uitbreidt met een compacte online toestand van associatief geheugen. δ-mem comprimeert eerdere informatie in een matrix met vaste grootte die wordt bijgewerkt door delta-regelleren, en gebruikt de uitlezing om lagerangs-correcties te genereren op de aandachtberekening van de backbone tijdens het genereren. Met slechts een 8×8 online geheugentoestand verbetert δ-mem de gemiddelde score tot 1,10× die van de bevroren backbone en 1,15× die van de sterkste niet-δ-mem geheugenbaseline. Het behaalt grotere winsten op geheugenintensieve benchmarks, met 1,31× op MemoryAgentBench en 1,20× op LoCoMo, terwijl het algemene capaciteiten grotendeels behoudt. Deze resultaten tonen aan dat effectief geheugen kan worden gerealiseerd door een compacte online toestand die direct is gekoppeld aan aandachtberekening, zonder volledige fine-tuning, vervanging van de backbone of expliciete contextuitbreiding.
English
Large language models increasingly need to accumulate and reuse historical information in long-term assistants and agent systems. Simply expanding the context window is costly and often fails to ensure effective context utilization. We propose δ-mem, a lightweight memory mechanism that augments a frozen full-attention backbone with a compact online state of associative memory. δ-mem compresses past information into a fixed-size state matrix updated by delta-rule learning, and uses its readout to generate low-rank corrections to the backbone's attention computation during generation. With only an 8times8 online memory state, δ-mem improves the average score to 1.10times that of the frozen backbone and 1.15times that of the strongest non-δ-mem memory baseline. It achieves larger gains on memory-heavy benchmarks, reaching 1.31times on MemoryAgentBench and 1.20times on LoCoMo, while largely preserving general capabilities. These results show that effective memory can be realized through a compact online state directly coupled with attention computation, without full fine-tuning, backbone replacement, or explicit context extension.