ChatPaper.aiChatPaper

ABot-AgentOS: Een Algemeen Robotagent Besturingssysteem met Levenslang Multi-modaal Geheugen

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

July 11, 2026
Auteurs: Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Mingyang Yin, Zedong Chu, Mu Xu
cs.AI

Samenvatting

Recente VLM- en VLA-systemen hebben de robotperceptie en actievoorspelling verbeterd, maar langetermijn belichaamde agenten hebben nog steeds een algemene runtime-laag nodig voor redeneren, geheugen, gebruik van hulpmiddelen, verificatie en uitvoering over verschillende belichamingen. Wij presenteren ABot-AgentOS, een algemeen robotisch Agent Operating System dat zich boven laagniveaucontrollers bevindt en een deliberatieve agentlaag biedt voor scenario-afhankelijke planning, context-geïsoleerde vaardigheidsuitvoering, meerstapsverificatie, multimodaal geheugen en edge-cloud-samenwerking. Om dergelijke systemen te evalueren, introduceren wij EmbodiedWorldBench, een uitvoerbare benchmark met 16 binnen-, buiten- en hybride scenario's, vier moeilijkheidsgraden en meer dan 200 taken, waaronder navigatie, objectzoektochten, NPC-dialogen, dynamische gebeurtenissen en spoorgebaseerde scoring. ABot-AgentOS introduceert verder Universeel Multimodaal Grafiekgeheugen, een persistent bronverankerd substraat dat dialoog, visuele waarnemingen, ruimtelijke context, temporele relaties en taaksporen omzet in getypeerde knooppunten en randen. Een falingsgedreven zelfevolutielus zet gediagnosticeerde geheugenfouten om in gegate runtime-evo-assets die pas worden gepromoveerd naar latere evaluatiesplits, waardoor ground-truth-lekkage in de huidige split wordt voorkomen en continue verbetering mogelijk wordt. Op een eerste EmbodiedWorldBench-deelverzameling verbetert ABot-AgentOS ten opzichte van een baseline met enkele controller, zowel in taaksucces als doelvoltooiing. Op geheugenbenchmarks behaalt ABot-AgentOS Static 87,5 op LoCoMo, 59,9 op OpenEQA EM-EQA, 88,6 op Mem-Gallery en 76,5 Acc@All op NExT-QA; zelfevolutie verbetert LoCoMo verder naar 88,7, OpenEQA naar 60,4 en Mem-Gallery naar 89,0. Deze resultaten suggereren dat een algemene Agent OS-laag de langetermijn belichaamde uitvoering kan verbeteren, terwijl persistent, controleerbaar geheugen voor continue interactie wordt geboden.
English
Recent VLM and VLA systems have improved robotic perception and action prediction, yet long-horizon embodied agents still require a general runtime layer for reasoning, memory, tool use, verification, and cross-embodiment execution. We present ABot-AgentOS, a general robotic Agent Operating System that sits above low-level controllers and provides a deliberative agent layer for scene-conditioned planning, context-isolated skill execution, multi-stage verification, multi-modal memory, and edge-cloud collaboration. To evaluate such systems, we introduce EmbodiedWorldBench, an executable benchmark with 16 indoor, outdoor, and hybrid scenes, four difficulty levels, and over 200 tasks involving navigation, object search, NPC dialogue, dynamic events, and trace-grounded scoring. ABot-AgentOS further introduces Universal Multi-modal Graph Memory, a persistent source-grounded substrate that converts dialogue, visual observations, spatial context, temporal relations, and task traces into typed nodes and edges. A failure-driven self-evolution loop converts diagnosed memory failures into gated runtime evo-assets that are promoted only to later evaluation splits, preventing current-split ground-truth leakage while enabling continual improvement. On an initial EmbodiedWorldBench subset, ABot-AgentOS improves over a single-controller baseline in both task success and goal completion. Across memory benchmarks, ABot-AgentOS Static achieves 87.5 on LoCoMo, 59.9 on OpenEQA EM-EQA, 88.6 on Mem-Gallery, and 76.5 Acc@All on NExT-QA; self-evolution further improves LoCoMo to 88.7, OpenEQA to 60.4, and Mem-Gallery to 89.0. These results suggest that a general Agent OS layer can improve long-horizon embodied execution while providing persistent, auditable memory for continual interaction.