EventVLA : Mémoire de preuves visuelles basée sur les événements pour les politiques vision-langage-action à long horizon
EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies
June 18, 2026
Auteurs: Ganlin Yang, Zhangzheng Tu, Yuqiang Yang, Sitong Mao, Junyi Dong, Tianxing Chen, Jiaqi Peng, Jing Xiong, Jiafei Cao, Jifeng Dai, Wengang Zhou, Yao Mu, Tai Wang
cs.AI
Résumé
La mémoire reste un goulot d'étranglement critique pour la manipulation robotique à long horizon, car les politiques standard de type Vision-Langage-Action (VLA) échouent souvent lorsque les indices pertinents à la tâche deviennent occultés ou inobservables au fil du temps. Bien que les méthodes existantes augmentées par la mémoire exploitent le contexte historique, elles souffrent soit de sévères goulots d'étranglement informationnels, soit d'une latence élevée due à des systèmes doubles découplés, soit s'appuient sur des tampons non sélectifs qui accumulent des redondances visuelles massives. Pour remédier à ces limitations, nous introduisons EventVLA, un cadre de bout en bout fondé sur le concept de mémoire de preuves visuelles éparses, comprenant deux composants centraux : des ancres visuelles fondamentales pour conserver les contextes initial et à court terme, ainsi qu'un module de mémoire dynamique de preuves d'images clés (KEM). Plus précisément, le KEM prédit directement les probabilités futures d'images clés à partir des plongements latents de la VLA pour capturer et stocker de manière autonome des événements visuels épars et critiques pour la tâche. Ce mécanisme basé sur la prospective permet à la politique d'évaluer dynamiquement l'utilité causale future des observations courantes, préservant les preuves visuelles transitoires avant qu'elles ne deviennent inobservables. De plus, nous proposons RoboTwin-MeM, un référentiel de diagnostic spécialement conçu pour évaluer les tâches de manipulation non-markoviennes avec preuves visuelles interactives. Des évaluations approfondies montrent que, sur 17 tâches de simulation nécessitant de la mémoire et 4 tâches bimanuelles réelles, EventVLA atteint une amélioration moyenne du taux de réussite de +40 % par rapport aux VLA les plus avancées augmentées par la mémoire.
English
Memory remains a critical bottleneck for long-horizon robotic manipulation, as standard Vision-Language-Action (VLA) policies often fail when task-relevant cues become occluded or unobservable over time. While existing memory-augmented methods utilize historical context, they either suffer from severe information bottlenecks, incur high latency via decoupled dual systems, or rely on unselective buffers that accumulate massive visual redundancies. To address these limitations, we introduce EventVLA, an end-to-end framework founded on the concept of sparse visual evidence memory that comprises two core components: foundational visual anchors to retain initial and short-term contexts, and a dynamic Keyframe Evidence Memory (KEM) module. Specifically, KEM directly predicts future keyframe probabilities from the VLA's latent embeddings to autonomously capture and store sparse, task-critical visual events. This foresight-driven mechanism empowers the policy to dynamically evaluate the future causal utility of current observations, preserving transient visual evidence before it becomes unobservable. Furthermore, we propose RoboTwin-MeM, a diagnostic benchmark specifically designed to evaluate non-Markovian manipulation tasks with interactive visual evidence. Extensive evaluations show that across 17 memory-requiring simulation tasks and 4 real-world bimanual tasks, EventVLA achieves an average success rate improvement of +40% over state-of-the-art memory-augmented VLAs.