Memória Latente Dual em Modelos de Visão-Linguagem-Ação para Manipulação Robótica
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
July 8, 2026
Autores: Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan
cs.AI
Resumo
Os modelos mainstream de Visão-Linguagem-Ação (VLA) preveem ações principalmente a partir da observação atual sob uma suposição Markoviana, enfrentando assim dificuldades em tarefas de longo horizonte e temporalmente dependentes. Os VLAs existentes com memória aumentada ou expandem a janela de observação ou recuperam histórico do banco de memória como contexto auxiliar do lado da política. No entanto, eles deixam a memória fora do espaço latente nativo de raciocínio do VLA, impedindo que a experiência histórica seja intercalada de forma fluida com o raciocínio multimodal e a formação de ações. Para isso, apresentamos o LaMem-VLA, uma estrutura nativa de memória latente que reconstrói a experiência histórica em tokens de memória latente e os entrelaça diretamente com o raciocínio do VLA. Em seu núcleo, o LaMem-VLA introduz quatro componentes coordenados: (i) um curador que organiza a experiência histórica em dois cofres de memória complementares de curto e longo prazo; (ii) um buscador que consulta ambos os cofres usando a cognição multimodal para recuperar evidências relevantes ao contexto; (iii) um condensador que reconstrói as evidências recuperadas em tokens de memória latente compactos de curto e longo prazo; e (iv) um tecedor que injeta esses tokens de memória juntamente com a observação e instrução atuais em uma sequência contínua de embeddings. Ao representar, recuperar e consumir a experiência histórica inteiramente no mesmo espaço latente contínuo, o LaMem-VLA permite que a memória participe diretamente do raciocínio do VLA e oriente a geração de ações sob um contexto limitado. Extensos experimentos no SimplerEnv e no LIBERO demonstram a superioridade do nosso LaMem-VLA.
English
Mainstream Vision-Language-Action (VLA) models predict actions primarily from the current observation under a Markovian assumption, thus struggling with long-horizon, temporally dependent tasks. Existing memory-augmented VLAs either expand the observation window or retrieve history from the memory bank as auxiliary policy-side context. However, they leave memory outside the native latent embedding space of VLA reasoning, preventing historical experience from being fluidly interleaved with multimodal reasoning and action formation. To this end, we introduce LaMem-VLA, a latent-memory-native framework that reconstructs historical experience into latent memory tokens and directly interweaves them with VLA reasoning. At its core, LaMem-VLA introduces four coordinated components: (i) a curator that organizes historical experience into two complementary short-term and long-term memory vaults; (ii) a seeker that queries both vaults using the multimodal cognition to retrieve context-relevant evidence; (iii) a condenser that reconstructs the retrieved evidence into compact short-term and long-term latent memory tokens; and (iv) a weaver that injects these memory tokens with the current observation and instruction into one continuous embedding sequence. By representing, retrieving, and consuming historical experience entirely in the same continuous latent space, LaMem-VLA enables memory to directly participate in VLA reasoning and guide action generation under a bounded context. Extensive experiments on SimplerEnv and LIBERO demonstrate the superiority of our LaMem-VLA.