Memoria Latente Dual en Modelos de Visión-Lenguaje-Acción para Manipulación Robótica
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
July 8, 2026
Autores: Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan
cs.AI
Resumen
Los modelos dominantes de Visión-Lenguaje-Acción (VLA) predicen acciones principalmente a partir de la observación actual bajo una suposición Markoviana, por lo que tienen dificultades con tareas de horizonte largo y dependientes temporalmente. Los VLA existentes aumentados con memoria amplían la ventana de observación o recuperan el historial del banco de memoria como contexto auxiliar del lado de la política. Sin embargo, dejan la memoria fuera del espacio de incrustación latente nativo del razonamiento VLA, impidiendo que la experiencia histórica se entrelace fluidamente con el razonamiento multimodal y la formación de acciones. Con este fin, presentamos LaMem-VLA, un marco nativo de memoria latente que reconstruye la experiencia histórica en tokens de memoria latente y los entrelaza directamente con el razonamiento VLA. En su núcleo, LaMem-VLA introduce cuatro componentes coordinados: (i) un curador que organiza la experiencia histórica en dos bóvedas de memoria complementarias: de corto y largo plazo; (ii) un buscador que consulta ambas bóvedas utilizando la cognición multimodal para recuperar evidencia relevante al contexto; (iii) un condensador que reconstruye la evidencia recuperada en tokens de memoria latente compactos de corto y largo plazo; y (iv) un tejedor que inyecta estos tokens de memoria junto con la observación e instrucción actuales en una secuencia de incrustación continua. Al representar, recuperar y consumir la experiencia histórica enteramente en el mismo espacio latente continuo, LaMem-VLA permite que la memoria participe directamente en el razonamiento VLA y guíe la generación de acciones bajo un contexto acotado. Experimentos exhaustivos en SimplerEnv y LIBERO demuestran la superioridad de nuestro LaMem-VLA.
English
Mainstream Vision-Language-Action (VLA) models predict actions primarily from the current observation under a Markovian assumption, thus struggling with long-horizon, temporally dependent tasks. Existing memory-augmented VLAs either expand the observation window or retrieve history from the memory bank as auxiliary policy-side context. However, they leave memory outside the native latent embedding space of VLA reasoning, preventing historical experience from being fluidly interleaved with multimodal reasoning and action formation. To this end, we introduce LaMem-VLA, a latent-memory-native framework that reconstructs historical experience into latent memory tokens and directly interweaves them with VLA reasoning. At its core, LaMem-VLA introduces four coordinated components: (i) a curator that organizes historical experience into two complementary short-term and long-term memory vaults; (ii) a seeker that queries both vaults using the multimodal cognition to retrieve context-relevant evidence; (iii) a condenser that reconstructs the retrieved evidence into compact short-term and long-term latent memory tokens; and (iv) a weaver that injects these memory tokens with the current observation and instruction into one continuous embedding sequence. By representing, retrieving, and consuming historical experience entirely in the same continuous latent space, LaMem-VLA enables memory to directly participate in VLA reasoning and guide action generation under a bounded context. Extensive experiments on SimplerEnv and LIBERO demonstrate the superiority of our LaMem-VLA.