Mela : Consolidation de mémoire en phase de test basée sur l'hypothèse de transformation
Mela: Test-Time Memory Consolidation based on Transformation Hypothesis
May 11, 2026
Auteurs: Lungchuan Chen
cs.AI
Résumé
La consolidation de la mémoire, processus par lequel des expériences transitoires sont transformées en représentations stables et structurées, est un principe d'organisation fondamental du cerveau humain, mais reste largement inexplorée en tant que principe de conception pour les modèles séquentiels modernes. Dans ce travail, nous exploitons des théories neuroscientifiques établies de la consolidation de la mémoire et du couplage inter-fréquences pour proposer le Module de Mémoire Hiérarchique (HMM), une architecture de mémoire neuronale composée de deux sous-modules fonctionnellement distincts opérant à des fréquences de mise à jour différentes. Inspiré par l'hypothèse de transformation, le sous-module basse fréquence produit des représentations de haut niveau qui capturent des connaissances abstraites et générales, tandis que le sous-module haute fréquence produit des représentations fines qui préservent des détails épisodiques plus riches. La sortie mémoire finale est reconstruite dynamiquement comme une combinaison dépendante du contexte des deux représentations, analogue à la nature reconstructive du rappel de mémoire humaine. Nous intégrons HMM dans un décodeur de langage basé sur Transformer pour former Mela, une famille de modèles de langage augmentés par la mémoire qui effectuent une consolidation de mémoire en ligne au moment du test. Pour exploiter davantage les représentations mémoire multi-granularités produites par HMM, nous introduisons MemStack, une méthode qui distribue différents niveaux de caractéristiques mémoire à travers les premières couches du décodeur sans introduire de jetons supplémentaires. Les expériences de modélisation du langage démontrent que Mela surpasse les modèles de référence Transformer pour toutes les tailles de modèles. De plus, avec une longueur de contexte pré-entraîné fixée à 4K, Mela maintient ses performances sur des contextes significativement plus longs, tandis que les modèles de référence Transformer se dégradent rapidement au-delà de leur longueur d'entraînement. Des études d'ablation approfondies valident la contribution de chaque composant et fournissent des indications pour une configuration pratique.
English
Memory consolidation, the process by which transient experiences are transformed into stable, structured representations, is a foundational organizing principle in the human brain, yet it remains largely unexplored as a design principle for modern sequence models. In this work, we leverage established neuroscientific theories of memory consolidation and cross-frequency coupling to propose the Hierarchical Memory Module (HMM), a neural memory architecture composed of two functionally distinct sub-modules that operate at different update frequencies. Inspired by the transformation hypothesis, the low-frequency sub-module produces high-level representations that capture abstract, gist-level knowledge, while the high-frequency sub-module produces fine-grained representations that preserve richer episodic detail. The final memory output is dynamically reconstructed as a context-dependent combination of both representations, analogous to the reconstructive nature of human memory retrieval. We integrate HMM into a Transformer-based language decoder to form Mela, a family of memory-augmented language models that perform online memory consolidation at test time. To further exploit the multi-granularity memory representations produced by HMM, we introduce MemStack, a method that distributes different levels of memory features across the early layers of the decoder without introducing additional tokens. Experiments on language modeling demonstrate that Mela outperforms Transformer baselines across all the model sizes. Moreover, with the pretrained context length fixed at 4K, Mela maintains performance on significantly longer contexts, whereas Transformer baselines degrade rapidly beyond their training length. Extensive ablation studies validate the contribution of each component and provide guidance for practical configuration.