Duaal Latent Geheugen in Visie-Taal-Actiemodellen voor Robotmanipulatie
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
July 8, 2026
Auteurs: Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan
cs.AI
Samenvatting
Mainstream Vision-Language-Action (VLA)-modellen voorspellen acties voornamelijk op basis van de huidige observatie onder een Markov-aanname, waardoor ze moeite hebben met langdurige, temporeel afhankelijke taken. Bestaande geheugengeaugmenteerde VLA's vergroten ofwel het observatievenster of halen geschiedenis op uit het geheugenbank als hulpcontext aan de beleidszijde. Ze laten het geheugen echter buiten de eigenlijke latente inbeddingsruimte van VLA-redenering, waardoor historische ervaring niet vloeiend kan worden verweven met multimodale redenering en actievorming. Daartoe introduceren we LaMem-VLA, een latent-geheugen-native raamwerk dat historische ervaring reconstrueert in latente geheugentokens en deze direct verweeft met VLA-redenering. De kern van LaMem-VLA bestaat uit vier gecoördineerde componenten: (i) een curator die historische ervaring organiseert in twee complementaire korte- en langetermijngeheugenkluizen; (ii) een zoeker die beide kluizen bevraagt met behulp van de multimodale cognitie om contextrelevante bewijzen op te halen; (iii) een condensor die de opgehaalde bewijzen reconstrueert in compacte korte- en langetermijn latente geheugentokens; en (iv) een wever die deze geheugentokens samen met de huidige observatie en instructie in één continue inbeddingsreeks injecteert. Door historische ervaring volledig in dezelfde continue latente ruimte te representeren, op te halen en te consumeren, stelt LaMem-VLA het geheugen in staat om direct deel te nemen aan VLA-redenering en actiegeneratie te sturen onder een begrensde context. Uitgebreide experimenten op SimplerEnv en LIBERO tonen de superioriteit van onze LaMem-VLA aan.
English
Mainstream Vision-Language-Action (VLA) models predict actions primarily from the current observation under a Markovian assumption, thus struggling with long-horizon, temporally dependent tasks. Existing memory-augmented VLAs either expand the observation window or retrieve history from the memory bank as auxiliary policy-side context. However, they leave memory outside the native latent embedding space of VLA reasoning, preventing historical experience from being fluidly interleaved with multimodal reasoning and action formation. To this end, we introduce LaMem-VLA, a latent-memory-native framework that reconstructs historical experience into latent memory tokens and directly interweaves them with VLA reasoning. At its core, LaMem-VLA introduces four coordinated components: (i) a curator that organizes historical experience into two complementary short-term and long-term memory vaults; (ii) a seeker that queries both vaults using the multimodal cognition to retrieve context-relevant evidence; (iii) a condenser that reconstructs the retrieved evidence into compact short-term and long-term latent memory tokens; and (iv) a weaver that injects these memory tokens with the current observation and instruction into one continuous embedding sequence. By representing, retrieving, and consuming historical experience entirely in the same continuous latent space, LaMem-VLA enables memory to directly participate in VLA reasoning and guide action generation under a bounded context. Extensive experiments on SimplerEnv and LIBERO demonstrate the superiority of our LaMem-VLA.