ChatPaper.aiChatPaper

RoboMemArena : un benchmark complet et exigeant de la mémoire robotique

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

May 11, 2026
Auteurs: Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li
cs.AI

Résumé

La mémoire est une composante essentielle de l'intelligence robotique, car les robots doivent s'appuyer sur les observations et actions passées pour accomplir des tâches à long horizon dans des environnements partiellement observables. Cependant, les référentiels de mémoire robotique existants manquent encore d'annotations multimodales pour la formation de la mémoire, offrent une couverture limitée des tâches et une complexité structurelle restreinte, et demeurent confinés à la simulation sans évaluation dans le monde réel. Nous comblons cette lacune avec RoboMemArena, un référentiel à grande échelle comprenant 26 tâches, avec des longueurs de trajectoire moyennes dépassant 1 000 pas par tâche et 68,9 % des sous-tâches dépendant de la mémoire. Le pipeline de génération utilise un modèle de vision-langage (VLM) pour concevoir et composer les sous-tâches, génère des trajectoires complètes via des fonctions atomiques, et fournit des annotations liées à la mémoire, notamment des instructions de sous-tâches et des annotations natives d'images clés, tandis que des tâches de mémoire appariées dans le monde réel permettent une évaluation physique. Nous concevons également PrediMem, un VLA à double système dans lequel un planificateur VLM de haut niveau gère une banque de mémoire avec des tampons récents et d'images clés, et utilise une tête de codage prédictif pour améliorer la sensibilité à la dynamique des tâches. Des expériences approfondies sur RoboMemArena montrent que PrediMem surpasse toutes les bases de référence et fournit des informations sur la gestion de la mémoire, l'architecture du modèle et les lois d'échelle pour les systèmes de mémoire complexes.
English
Memory is a critical component of robotic intelligence, as robots must rely on past observations and actions to accomplish long-horizon tasks in partially observable environments. However, existing robotic memory benchmarks still lack multimodal annotations for memory formation, provide limited task coverage and structural complexity, and remain restricted to simulation without real-world evaluation. We address this gap with RoboMemArena, a large-scale benchmark of 26 tasks, with average trajectory lengths exceeding 1,000 steps per task and 68.9% of subtasks being memory-dependent. The generation pipeline leverages a vision-language model (VLM) to design and compose subtasks, generates full trajectories through atomic functions, and provides memory-related annotations, including subtask instructions and native keyframe annotations, while paired real-world memory tasks support physical evaluation. We further design PrediMem, a dual-system VLA in which a high-level VLM planner manages a memory bank with recent and keyframe buffers and uses a predictive coding head to improve sensitivity to task dynamics. Extensive experiments on RoboMemArena show that PrediMem outperforms all baselines and provides insights into memory management, model architecture, and scaling laws for complex memory systems.