ChatPaper.aiChatPaper

RoboMemArena: Um Benchmark Abrangente e Desafiador de Memória Robótica

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

May 11, 2026
Autores: Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li
cs.AI

Resumo

A memória é um componente crítico da inteligência robótica, pois os robôs devem confiar em observações e ações passadas para realizar tarefas de longo horizonte em ambientes parcialmente observáveis. No entanto, os benchmarks existentes de memória robótica ainda carecem de anotações multimodais para formação de memória, oferecem cobertura limitada de tarefas e complexidade estrutural, e permanecem restritos à simulação sem avaliação no mundo real. Abordamos essa lacuna com o RoboMemArena, um benchmark de grande escala composto por 26 tarefas, com comprimentos médios de trajetória superiores a 1.000 passos por tarefa e 68,9% das subtarefas sendo dependentes de memória. O pipeline de geração utiliza um modelo de linguagem-visão (VLM) para projetar e compor subtarefas, gera trajetórias completas por meio de funções atômicas e fornece anotações relacionadas à memória, incluindo instruções de subtarefas e anotações nativas de keyframes, enquanto tarefas de memória pareadas no mundo real apoiam a avaliação física. Projetamos ainda o PrediMem, um VLA de sistema duplo no qual um planejador VLM de alto nível gerencia um banco de memória com buffers recentes e de keyframes e usa uma cabeça de codificação preditiva para melhorar a sensibilidade à dinâmica das tarefas. Experimentos extensivos no RoboMemArena mostram que o PrediMem supera todas as linhas de base e fornece insights sobre gerenciamento de memória, arquitetura de modelo e leis de escala para sistemas de memória complexos.
English
Memory is a critical component of robotic intelligence, as robots must rely on past observations and actions to accomplish long-horizon tasks in partially observable environments. However, existing robotic memory benchmarks still lack multimodal annotations for memory formation, provide limited task coverage and structural complexity, and remain restricted to simulation without real-world evaluation. We address this gap with RoboMemArena, a large-scale benchmark of 26 tasks, with average trajectory lengths exceeding 1,000 steps per task and 68.9% of subtasks being memory-dependent. The generation pipeline leverages a vision-language model (VLM) to design and compose subtasks, generates full trajectories through atomic functions, and provides memory-related annotations, including subtask instructions and native keyframe annotations, while paired real-world memory tasks support physical evaluation. We further design PrediMem, a dual-system VLA in which a high-level VLM planner manages a memory bank with recent and keyframe buffers and uses a predictive coding head to improve sensitivity to task dynamics. Extensive experiments on RoboMemArena show that PrediMem outperforms all baselines and provides insights into memory management, model architecture, and scaling laws for complex memory systems.