ChatPaper.aiChatPaper

EventVLA: Memória de Evidências Visuais Orientada a Eventos para Políticas de Visão-Linguagem-Ação de Longo Horizonte

EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies

June 18, 2026
Autores: Ganlin Yang, Zhangzheng Tu, Yuqiang Yang, Sitong Mao, Junyi Dong, Tianxing Chen, Jiaqi Peng, Jing Xiong, Jiafei Cao, Jifeng Dai, Wengang Zhou, Yao Mu, Tai Wang
cs.AI

Resumo

A memória continua sendo um gargalo crítico para a manipulação robótica de longo horizonte, uma vez que as políticas padrão de Visão-Linguagem-Ação (VLA) frequentemente falham quando pistas relevantes para a tarefa se tornam ocluídas ou não observáveis ao longo do tempo. Embora métodos existentes com memória aumentada utilizem contexto histórico, eles sofrem de sérios gargalos de informação, incorrem em alta latência devido a sistemas duplos desacoplados, ou dependem de buffers não seletivos que acumulam redundâncias visuais massivas. Para superar essas limitações, apresentamos o EventVLA, uma estrutura ponta a ponta fundamentada no conceito de memória de evidência visual esparsa, que compreende dois componentes centrais: âncoras visuais fundamentais para reter contextos iniciais e de curto prazo, e um módulo dinâmico de Memória de Evidência de Quadros-Chave (KEM - Keyframe Evidence Memory). Especificamente, o KEM prevê diretamente as probabilidades de quadros-chave futuros a partir das incorporações latentes da VLA para capturar e armazenar de forma autônoma eventos visuais críticos e esparsos para a tarefa. Esse mecanismo orientado por previsão capacita a política a avaliar dinamicamente a utilidade causal futura das observações atuais, preservando evidências visuais transitórias antes que se tornem não observáveis. Além disso, propomos o RoboTwin-MeM, um benchmark diagnóstico projetado especificamente para avaliar tarefas de manipulação não Markovianas com evidência visual interativa. Avaliações extensivas mostram que, em 17 tarefas simuladas que exigem memória e 4 tarefas bimanuais no mundo real, o EventVLA alcança uma melhoria média na taxa de sucesso de +40% em relação às VLAs com memória aumentada de última geração.
English
Memory remains a critical bottleneck for long-horizon robotic manipulation, as standard Vision-Language-Action (VLA) policies often fail when task-relevant cues become occluded or unobservable over time. While existing memory-augmented methods utilize historical context, they either suffer from severe information bottlenecks, incur high latency via decoupled dual systems, or rely on unselective buffers that accumulate massive visual redundancies. To address these limitations, we introduce EventVLA, an end-to-end framework founded on the concept of sparse visual evidence memory that comprises two core components: foundational visual anchors to retain initial and short-term contexts, and a dynamic Keyframe Evidence Memory (KEM) module. Specifically, KEM directly predicts future keyframe probabilities from the VLA's latent embeddings to autonomously capture and store sparse, task-critical visual events. This foresight-driven mechanism empowers the policy to dynamically evaluate the future causal utility of current observations, preserving transient visual evidence before it becomes unobservable. Furthermore, we propose RoboTwin-MeM, a diagnostic benchmark specifically designed to evaluate non-Markovian manipulation tasks with interactive visual evidence. Extensive evaluations show that across 17 memory-requiring simulation tasks and 4 real-world bimanual tasks, EventVLA achieves an average success rate improvement of +40% over state-of-the-art memory-augmented VLAs.