Mela: Consolidação de Memória em Tempo de Teste baseada na Hipótese de Transformação
Mela: Test-Time Memory Consolidation based on Transformation Hypothesis
May 11, 2026
Autores: Lungchuan Chen
cs.AI
Resumo
A consolidação da memória, processo pelo qual experiências transitórias são transformadas em representações estáveis e estruturadas, é um princípio organizacional fundamental no cérebro humano, porém permanece amplamente inexplorado como princípio de design para modelos sequenciais modernos. Neste trabalho, recorremos a teorias neurocientíficas consolidadas sobre consolidação da memória e acoplamento entre frequências para propor o Módulo de Memória Hierárquica (HMM), uma arquitetura neural de memória composta por dois submódulos funcionalmente distintos que operam em diferentes frequências de atualização. Inspirado pela hipótese da transformação, o submódulo de baixa frequência produz representações de alto nível que capturam conhecimento abstrato e essencial, enquanto o submódulo de alta frequência produz representações detalhadas que preservam informações episódicas mais ricas. A saída final da memória é reconstruída dinamicamente como uma combinação dependente do contexto de ambas as representações, análoga à natureza reconstrutiva da recuperação da memória humana. Integramos o HMM a um decodificador de linguagem baseado em Transformer para formar o Mela, uma família de modelos de linguagem aumentados por memória que realizam consolidação de memória online em tempo de teste. Para explorar ainda mais as representações de memória multigranularidade produzidas pelo HMM, introduzimos o MemStack, um método que distribui diferentes níveis de características de memória pelas camadas iniciais do decodificador sem introduzir tokens adicionais. Experimentos em modelagem de linguagem demonstram que o Mela supera as linhas de base Transformer em todos os tamanhos de modelo. Além disso, com o comprimento do contexto pré-treinado fixado em 4K, o Mela mantém o desempenho em contextos significativamente mais longos, enquanto as linhas de base Transformer degradam rapidamente além do seu comprimento de treinamento. Extensos estudos de ablação validam a contribuição de cada componente e fornecem orientação para configurações práticas.
English
Memory consolidation, the process by which transient experiences are transformed into stable, structured representations, is a foundational organizing principle in the human brain, yet it remains largely unexplored as a design principle for modern sequence models. In this work, we leverage established neuroscientific theories of memory consolidation and cross-frequency coupling to propose the Hierarchical Memory Module (HMM), a neural memory architecture composed of two functionally distinct sub-modules that operate at different update frequencies. Inspired by the transformation hypothesis, the low-frequency sub-module produces high-level representations that capture abstract, gist-level knowledge, while the high-frequency sub-module produces fine-grained representations that preserve richer episodic detail. The final memory output is dynamically reconstructed as a context-dependent combination of both representations, analogous to the reconstructive nature of human memory retrieval. We integrate HMM into a Transformer-based language decoder to form Mela, a family of memory-augmented language models that perform online memory consolidation at test time. To further exploit the multi-granularity memory representations produced by HMM, we introduce MemStack, a method that distributes different levels of memory features across the early layers of the decoder without introducing additional tokens. Experiments on language modeling demonstrate that Mela outperforms Transformer baselines across all the model sizes. Moreover, with the pretrained context length fixed at 4K, Mela maintains performance on significantly longer contexts, whereas Transformer baselines degrade rapidly beyond their training length. Extensive ablation studies validate the contribution of each component and provide guidance for practical configuration.