ABot-AgentOS: Ein allgemeines Robotik-Agenten-OS mit lebenslangem multimodalem Gedächtnis
ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
July 11, 2026
Autoren: Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Mingyang Yin, Zedong Chu, Mu Xu
cs.AI
Zusammenfassung
Aktuelle VLM- und VLA-Systeme haben die robotische Wahrnehmung und Aktionsvorhersage verbessert, dennoch benötigen langfristig agierende verkörperte Agenten weiterhin eine allgemeine Laufzeitschicht für Reasoning, Gedächtnis, Werkzeugnutzung, Verifikation und ausführungsübergreifende Umsetzung. Wir stellen ABot-AgentOS vor, ein allgemeines robotisches Agentenbetriebssystem, das oberhalb von Low-Level-Controllern angesiedelt ist und eine deliberative Agentenschicht für szenenbedingte Planung, kontextisolierte Fertigkeitsausführung, mehrstufige Verifikation, multimodales Gedächtnis sowie Edge-Cloud-Kollaboration bereitstellt. Zur Evaluierung solcher Systeme führen wir EmbodiedWorldBench ein, einen ausführbaren Benchmark mit 16 Innen-, Außen- und Hybridszenen, vier Schwierigkeitsstufen und über 200 Aufgaben, die Navigation, Objektsuche, NPC-Dialoge, dynamische Ereignisse und nachverfolgungsbasierte Bewertung umfassen. ABot-AgentOS führt zudem den Universal Multi-modal Graph Memory ein, ein persistentes quellengebundenes Substrat, das Dialoge, visuelle Beobachtungen, räumlichen Kontext, zeitliche Beziehungen und Aufgabenabläufe in typisierte Knoten und Kanten umwandelt. Eine fehlergetriebene Selbstentwicklungsschleife wandelt diagnostizierte Gedächtnisfehler in gating-gesteuerte Runtime-Evo-Assets um, die nur zu späteren Evaluationssplits befördert werden; dies verhindert eine Ground-Truth-Leckage im aktuellen Split und ermöglicht gleichzeitig eine kontinuierliche Verbesserung. Auf einer initialen Teilmenge von EmbodiedWorldBench verbessert ABot-AgentOS gegenüber einer Ein-Controller-Baseline sowohl die Aufgabenerfolgsrate als auch die Zielerreichung. Über mehrere Gedächtnis-Benchmarks hinweg erreicht ABot-AgentOS Static 87,5 auf LoCoMo, 59,9 auf OpenEQA EM-EQA, 88,6 auf Mem-Gallery und 76,5 Acc@All auf NExT-QA; durch Selbstentwicklung verbessern sich die Werte auf 88,7 (LoCoMo), 60,4 (OpenEQA) und 89,0 (Mem-Gallery). Diese Ergebnisse deuten darauf hin, dass eine allgemeine Agent-OS-Schicht die langfristige verkörperte Ausführung verbessern kann, während sie ein persistentes, auditierbares Gedächtnis für kontinuierliche Interaktion bereitstellt.
English
Recent VLM and VLA systems have improved robotic perception and action prediction, yet long-horizon embodied agents still require a general runtime layer for reasoning, memory, tool use, verification, and cross-embodiment execution. We present ABot-AgentOS, a general robotic Agent Operating System that sits above low-level controllers and provides a deliberative agent layer for scene-conditioned planning, context-isolated skill execution, multi-stage verification, multi-modal memory, and edge-cloud collaboration. To evaluate such systems, we introduce EmbodiedWorldBench, an executable benchmark with 16 indoor, outdoor, and hybrid scenes, four difficulty levels, and over 200 tasks involving navigation, object search, NPC dialogue, dynamic events, and trace-grounded scoring. ABot-AgentOS further introduces Universal Multi-modal Graph Memory, a persistent source-grounded substrate that converts dialogue, visual observations, spatial context, temporal relations, and task traces into typed nodes and edges. A failure-driven self-evolution loop converts diagnosed memory failures into gated runtime evo-assets that are promoted only to later evaluation splits, preventing current-split ground-truth leakage while enabling continual improvement. On an initial EmbodiedWorldBench subset, ABot-AgentOS improves over a single-controller baseline in both task success and goal completion. Across memory benchmarks, ABot-AgentOS Static achieves 87.5 on LoCoMo, 59.9 on OpenEQA EM-EQA, 88.6 on Mem-Gallery, and 76.5 Acc@All on NExT-QA; self-evolution further improves LoCoMo to 88.7, OpenEQA to 60.4, and Mem-Gallery to 89.0. These results suggest that a general Agent OS layer can improve long-horizon embodied execution while providing persistent, auditable memory for continual interaction.