ABot-AgentOS: Общая операционная система роботизированного агента с долговременной мультимодальной памятью

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

July 11, 2026
Авторы: Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Mingyang Yin, Zedong Chu, Mu Xu
cs.AI

Аннотация

Недавние системы VLM и VLA улучшили роботизированное восприятие и прогнозирование действий, однако долгосрочные воплощенные агенты по-прежнему требуют общего уровня выполнения для рассуждений, памяти, использования инструментов, верификации и исполнения на разных воплощениях. Мы представляем ABot-AgentOS — общую операционную систему для роботизированных агентов, которая располагается над низкоуровневыми контроллерами и предоставляет слой рассуждений агента для планирования с учетом сцены, изолированного по контексту выполнения навыков, многоэтапной верификации, мультимодальной памяти и взаимодействия между периферией и облаком. Для оценки подобных систем мы вводим EmbodiedWorldBench — исполняемый эталонный тест, включающий 16 сцен (внутренних, наружных и гибридных), четыре уровня сложности и более 200 задач, охватывающих навигацию, поиск объектов, диалог с NPC, динамические события и оценку на основе трасс. ABot-AgentOS также вводит универсальную мультимодальную графовую память — постоянный субстрат, привязанный к источникам, который преобразует диалог, визуальные наблюдения, пространственный контекст, временные отношения и трассы задач в типизированные узлы и ребра. Цикл самоэволюции, движимый сбоями, превращает диагностированные ошибки памяти в управляемые эволюционные активы времени выполнения, которые продвигаются только в более поздние разделы оценки, предотвращая утечку истинных значений в текущем разделе и обеспечивая непрерывное улучшение. На начальном подмножестве EmbodiedWorldBench ABot-AgentOS превосходит базовый алгоритм с одним контроллером как по успешности задач, так и по завершению целей. На эталонных тестах памяти статическая версия ABot-AgentOS достигает 87,5 на LoCoMo, 59,9 на OpenEQA EM-EQA, 88,6 на Mem-Gallery и 76,5 Acc@All на NExT-QA; самоэволюция дополнительно улучшает показатели LoCoMo до 88,7, OpenEQA до 60,4 и Mem-Gallery до 89,0. Эти результаты свидетельствуют о том, что общий слой агентной ОС может улучшить долгосрочное выполнение в воплощенной среде, одновременно обеспечивая постоянную проверяемую память для непрерывного взаимодействия.
English
Recent VLM and VLA systems have improved robotic perception and action prediction, yet long-horizon embodied agents still require a general runtime layer for reasoning, memory, tool use, verification, and cross-embodiment execution. We present ABot-AgentOS, a general robotic Agent Operating System that sits above low-level controllers and provides a deliberative agent layer for scene-conditioned planning, context-isolated skill execution, multi-stage verification, multi-modal memory, and edge-cloud collaboration. To evaluate such systems, we introduce EmbodiedWorldBench, an executable benchmark with 16 indoor, outdoor, and hybrid scenes, four difficulty levels, and over 200 tasks involving navigation, object search, NPC dialogue, dynamic events, and trace-grounded scoring. ABot-AgentOS further introduces Universal Multi-modal Graph Memory, a persistent source-grounded substrate that converts dialogue, visual observations, spatial context, temporal relations, and task traces into typed nodes and edges. A failure-driven self-evolution loop converts diagnosed memory failures into gated runtime evo-assets that are promoted only to later evaluation splits, preventing current-split ground-truth leakage while enabling continual improvement. On an initial EmbodiedWorldBench subset, ABot-AgentOS improves over a single-controller baseline in both task success and goal completion. Across memory benchmarks, ABot-AgentOS Static achieves 87.5 on LoCoMo, 59.9 on OpenEQA EM-EQA, 88.6 on Mem-Gallery, and 76.5 Acc@All on NExT-QA; self-evolution further improves LoCoMo to 88.7, OpenEQA to 60.4, and Mem-Gallery to 89.0. These results suggest that a general Agent OS layer can improve long-horizon embodied execution while providing persistent, auditable memory for continual interaction.
PDF681July 15, 2026