Mémoire Latente Duale dans les Modèles Vision-Langage-Action pour la Manipulation Robotique
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
July 8, 2026
Auteurs: Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan
cs.AI
Résumé
Les modèles Vision-Langage-Action (VLA) grand public prédisent principalement les actions à partir de l'observation courante sous une hypothèse markovienne, ce qui les rend inefficaces pour les tâches à long horizon et temporellement dépendantes. Les VLA à mémoire augmentée existants élargissent soit la fenêtre d'observation, soit récupèrent l'historique depuis la banque de mémoire comme contexte auxiliaire du côté politique. Cependant, ils laissent la mémoire en dehors de l'espace de plongement latent natif du raisonnement VLA, empêchant l'expérience historique d'être entrelacée de manière fluide avec le raisonnement multimodal et la formation des actions. Pour remédier à cela, nous introduisons LaMem-VLA, un cadre natif à mémoire latente qui reconstruit l'expérience historique en tokens de mémoire latents et les entrelace directement avec le raisonnement VLA. Au cœur de LaMem-VLA se trouvent quatre composants coordonnés : (i) un conservateur qui organise l'expérience historique en deux coffres de mémoire complémentaires, à court terme et à long terme ; (ii) un chercheur qui interroge les deux coffres en utilisant la cognition multimodale pour récupérer les preuves pertinentes au contexte ; (iii) un condenseur qui reconstruit les preuves récupérées en tokens de mémoire latents compacts à court terme et à long terme ; et (iv) un tisseur qui injecte ces tokens de mémoire, ainsi que l'observation et l'instruction courantes, dans une séquence de plongement continue. En représentant, récupérant et consommant l'expérience historique entièrement dans le même espace latent continu, LaMem-VLA permet à la mémoire de participer directement au raisonnement VLA et de guider la génération d'actions dans un contexte borné. Des expériences approfondies sur SimplerEnv et LIBERO démontrent la supériorité de notre LaMem-VLA.
English
Mainstream Vision-Language-Action (VLA) models predict actions primarily from the current observation under a Markovian assumption, thus struggling with long-horizon, temporally dependent tasks. Existing memory-augmented VLAs either expand the observation window or retrieve history from the memory bank as auxiliary policy-side context. However, they leave memory outside the native latent embedding space of VLA reasoning, preventing historical experience from being fluidly interleaved with multimodal reasoning and action formation. To this end, we introduce LaMem-VLA, a latent-memory-native framework that reconstructs historical experience into latent memory tokens and directly interweaves them with VLA reasoning. At its core, LaMem-VLA introduces four coordinated components: (i) a curator that organizes historical experience into two complementary short-term and long-term memory vaults; (ii) a seeker that queries both vaults using the multimodal cognition to retrieve context-relevant evidence; (iii) a condenser that reconstructs the retrieved evidence into compact short-term and long-term latent memory tokens; and (iv) a weaver that injects these memory tokens with the current observation and instruction into one continuous embedding sequence. By representing, retrieving, and consuming historical experience entirely in the same continuous latent space, LaMem-VLA enables memory to directly participate in VLA reasoning and guide action generation under a bounded context. Extensive experiments on SimplerEnv and LIBERO demonstrate the superiority of our LaMem-VLA.