ChatPaper.aiChatPaper

δ-mem: Memória Online Eficiente para Modelos de Linguagem de Grande Porte

δ-mem: Efficient Online Memory for Large Language Models

May 12, 2026
Autores: Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria
cs.AI

Resumo

Modelos de linguagem de grande escala precisam cada vez mais acumular e reutilizar informações históricas em sistemas de assistentes e agentes de longo prazo. Simplesmente expandir a janela de contexto é custoso e frequentemente falha em garantir a utilização eficaz do contexto. Propomos o δ-mem, um mecanismo de memória leve que aumenta um backbone de atenção total congelado com um estado online compacto de memória associativa. O δ-mem comprime informações passadas em uma matriz de estado de tamanho fixo atualizada por aprendizado de regra delta, e utiliza sua leitura para gerar correções de baixo postos no cálculo de atenção do backbone durante a geração. Com apenas um estado de memória online de 8x8, o δ-mem melhora a pontuação média para 1,10 vezes a do backbone congelado e 1,15 vezes a do baseline de memória não-δ-mem mais forte. Ele obtém ganhos maiores em benchmarks intensivos em memória, alcançando 1,31 vezes no MemoryAgentBench e 1,20 vezes no LoCoMo, enquanto preserva amplamente as capacidades gerais. Esses resultados mostram que uma memória eficaz pode ser realizada por meio de um estado online compacto diretamente acoplado ao cálculo de atenção, sem ajuste fino completo, substituição do backbone ou extensão explícita do contexto.
English
Large language models increasingly need to accumulate and reuse historical information in long-term assistants and agent systems. Simply expanding the context window is costly and often fails to ensure effective context utilization. We propose δ-mem, a lightweight memory mechanism that augments a frozen full-attention backbone with a compact online state of associative memory. δ-mem compresses past information into a fixed-size state matrix updated by delta-rule learning, and uses its readout to generate low-rank corrections to the backbone's attention computation during generation. With only an 8times8 online memory state, δ-mem improves the average score to 1.10times that of the frozen backbone and 1.15times that of the strongest non-δ-mem memory baseline. It achieves larger gains on memory-heavy benchmarks, reaching 1.31times on MemoryAgentBench and 1.20times on LoCoMo, while largely preserving general capabilities. These results show that effective memory can be realized through a compact online state directly coupled with attention computation, without full fine-tuning, backbone replacement, or explicit context extension.