Двойная скрытая память в моделях «зрение-язык-действие» для роботизированной манипуляции
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
July 8, 2026
Авторы: Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan
cs.AI
Аннотация
Основные модели Vision-Language-Action (VLA) прогнозируют действия преимущественно на основе текущего наблюдения в рамках марковского предположения, что затрудняет выполнение долгосрочных задач, зависящих от временной последовательности. Существующие VLA с дополненной памятью либо расширяют окно наблюдения, либо извлекают историю из банка памяти в качестве вспомогательного контекста на стороне политики. Однако они оставляют память за пределами нативного латентного пространства вложений рассуждений VLA, не позволяя историческому опыту плавно переплетаться с мультимодальным рассуждением и формированием действий. Для решения этой проблемы мы представляем LaMem-VLA — фреймворк с нативной латентной памятью, который реконструирует прошлый опыт в латентные токены памяти и напрямую переплетает их с рассуждениями VLA. В основе LaMem-VLA лежат четыре согласованных компонента: (i) куратор, организующий прошлый опыт в два взаимодополняющих хранилища — кратковременной и долговременной памяти; (ii) поисковик, запрашивающий оба хранилища с использованием мультимодального познания для извлечения релевантных контексту свидетельств; (iii) конденсатор, реконструирующий извлечённые свидетельства в компактные кратковременные и долговременные латентные токены памяти; и (iv) вплетатель, внедряющий эти токены памяти вместе с текущим наблюдением и инструкцией в одну непрерывную последовательность вложений. Представляя, извлекая и используя исторический опыт полностью в одном и том же непрерывном латентном пространстве, LaMem-VLA позволяет памяти напрямую участвовать в рассуждениях VLA и направлять генерацию действий в условиях ограниченного контекста. Обширные эксперименты на SimplerEnv и LIBERO демонстрируют превосходство нашего LaMem-VLA.
English
Mainstream Vision-Language-Action (VLA) models predict actions primarily from the current observation under a Markovian assumption, thus struggling with long-horizon, temporally dependent tasks. Existing memory-augmented VLAs either expand the observation window or retrieve history from the memory bank as auxiliary policy-side context. However, they leave memory outside the native latent embedding space of VLA reasoning, preventing historical experience from being fluidly interleaved with multimodal reasoning and action formation. To this end, we introduce LaMem-VLA, a latent-memory-native framework that reconstructs historical experience into latent memory tokens and directly interweaves them with VLA reasoning. At its core, LaMem-VLA introduces four coordinated components: (i) a curator that organizes historical experience into two complementary short-term and long-term memory vaults; (ii) a seeker that queries both vaults using the multimodal cognition to retrieve context-relevant evidence; (iii) a condenser that reconstructs the retrieved evidence into compact short-term and long-term latent memory tokens; and (iv) a weaver that injects these memory tokens with the current observation and instruction into one continuous embedding sequence. By representing, retrieving, and consuming historical experience entirely in the same continuous latent space, LaMem-VLA enables memory to directly participate in VLA reasoning and guide action generation under a bounded context. Extensive experiments on SimplerEnv and LIBERO demonstrate the superiority of our LaMem-VLA.