ABot-AgentOS : un OS général pour agent robotique avec mémoire multimodale permanente
ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
July 11, 2026
Auteurs: Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Mingyang Yin, Zedong Chu, Mu Xu
cs.AI
Résumé
Les systèmes récents de type VLM et VLA ont amélioré la perception robotique et la prédiction d'actions, mais les agents incarnés à long horizon nécessitent encore une couche d'exécution générique pour le raisonnement, la mémoire, l'utilisation d'outils, la vérification et l'exécution inter-embodiments. Nous présentons ABot-AgentOS, un système d'exploitation agent robotique général qui se situe au-dessus des contrôleurs de bas niveau et fournit une couche agent délibérative pour la planification conditionnée par la scène, l'exécution de compétences en contexte isolé, la vérification multi-étapes, la mémoire multimodale et la collaboration edge-cloud. Pour évaluer de tels systèmes, nous introduisons EmbodiedWorldBench, un benchmark exécutable comprenant 16 scènes intérieures, extérieures et hybrides, quatre niveaux de difficulté, et plus de 200 tâches incluant la navigation, la recherche d'objets, le dialogue avec des PNJ, des événements dynamiques et une notation fondée sur les traces. ABot-AgentOS introduit en outre Universal Multi-modal Graph Memory, un substrat persistant ancré dans les sources qui convertit le dialogue, les observations visuelles, le contexte spatial, les relations temporelles et les traces de tâches en nœuds et arêtes typés. Une boucle d'auto-évolution pilotée par les échecs transforme les défaillances de mémoire diagnostiquées en actifs évolutifs d'exécution contrôlés, qui ne sont promus que dans les splits d'évaluation ultérieurs, évitant ainsi les fuites de vérité terrain du split actuel tout en permettant une amélioration continue. Sur un sous-ensemble initial d'EmbodiedWorldBench, ABot-AgentOS améliore à la fois le succès des tâches et l'achèvement des objectifs par rapport à une baseline à contrôleur unique. Sur les benchmarks de mémoire, ABot-AgentOS Static atteint 87,5 sur LoCoMo, 59,9 sur OpenEQA EM-EQA, 88,6 sur Mem-Gallery et 76,5 Acc@All sur NExT-QA ; l'auto-évolution améliore encore LoCoMo à 88,7, OpenEQA à 60,4 et Mem-Gallery à 89,0. Ces résultats suggérer qu'une couche OS Agent générale peut améliorer l'exécution incarnée à long horizon tout en fournissant une mémoire persistante et vérifiable pour une interaction continue.
English
Recent VLM and VLA systems have improved robotic perception and action prediction, yet long-horizon embodied agents still require a general runtime layer for reasoning, memory, tool use, verification, and cross-embodiment execution. We present ABot-AgentOS, a general robotic Agent Operating System that sits above low-level controllers and provides a deliberative agent layer for scene-conditioned planning, context-isolated skill execution, multi-stage verification, multi-modal memory, and edge-cloud collaboration. To evaluate such systems, we introduce EmbodiedWorldBench, an executable benchmark with 16 indoor, outdoor, and hybrid scenes, four difficulty levels, and over 200 tasks involving navigation, object search, NPC dialogue, dynamic events, and trace-grounded scoring. ABot-AgentOS further introduces Universal Multi-modal Graph Memory, a persistent source-grounded substrate that converts dialogue, visual observations, spatial context, temporal relations, and task traces into typed nodes and edges. A failure-driven self-evolution loop converts diagnosed memory failures into gated runtime evo-assets that are promoted only to later evaluation splits, preventing current-split ground-truth leakage while enabling continual improvement. On an initial EmbodiedWorldBench subset, ABot-AgentOS improves over a single-controller baseline in both task success and goal completion. Across memory benchmarks, ABot-AgentOS Static achieves 87.5 on LoCoMo, 59.9 on OpenEQA EM-EQA, 88.6 on Mem-Gallery, and 76.5 Acc@All on NExT-QA; self-evolution further improves LoCoMo to 88.7, OpenEQA to 60.4, and Mem-Gallery to 89.0. These results suggest that a general Agent OS layer can improve long-horizon embodied execution while providing persistent, auditable memory for continual interaction.