ABot-AgentOS: Un Sistema Operativo de Agente Robótico General con Memoria Multimodal Permanente

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

July 11, 2026
Autores: Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Mingyang Yin, Zedong Chu, Mu Xu
cs.AI

Resumen

Los sistemas recientes de VLM y VLA han mejorado la percepción robótica y la predicción de acciones, pero los agentes incorporados de horizonte prolongado aún requieren una capa de ejecución general para el razonamiento, la memoria, el uso de herramientas, la verificación y la ejecución entre diferentes cuerpos. Presentamos ABot-AgentOS, un Sistema Operativo de Agente robótico general que se sitúa por encima de los controladores de bajo nivel y proporciona una capa de agente deliberativa para la planificación condicionada por la escena, la ejecución de habilidades aisladas por contexto, la verificación en múltiples etapas, la memoria multimodal y la colaboración borde-nube. Para evaluar dichos sistemas, introducimos EmbodiedWorldBench, un punto de referencia ejecutable con 16 escenas interiores, exteriores e híbridas, cuatro niveles de dificultad y más de 200 tareas que implican navegación, búsqueda de objetos, diálogo con NPC, eventos dinámicos y puntuación basada en trazas. ABot-AgentOS introduce además la Memoria Gráfica Multimodal Universal, un sustrato persistente fundamentado en fuentes que convierte diálogos, observaciones visuales, contexto espacial, relaciones temporales y trazas de tareas en nodos y aristas tipificados. Un bucle de autoevolución impulsado por fallos convierte los fallos de memoria diagnosticados en evo-activos de ejecución controlados que se promocionan solo a divisiones de evaluación posteriores, evitando la filtración de datos de referencia de la división actual y permitiendo una mejora continua. En un subconjunto inicial de EmbodiedWorldBench, ABot-AgentOS mejora respecto a una línea base de un solo controlador tanto en éxito de tareas como en finalización de objetivos. En los puntos de referencia de memoria, ABot-AgentOS Static alcanza 87.5 en LoCoMo, 59.9 en OpenEQA EM-EQA, 88.6 en Mem-Gallery y 76.5 en Acc@All en NExT-QA; la autoevolución mejora aún más LoCoMo a 88.7, OpenEQA a 60.4 y Mem-Gallery a 89.0. Estos resultados sugieren que una capa general de Sistema Operativo de Agente puede mejorar la ejecución incorporada de horizonte prolongado, al tiempo que proporciona una memoria persistente y auditable para la interacción continua.
English
Recent VLM and VLA systems have improved robotic perception and action prediction, yet long-horizon embodied agents still require a general runtime layer for reasoning, memory, tool use, verification, and cross-embodiment execution. We present ABot-AgentOS, a general robotic Agent Operating System that sits above low-level controllers and provides a deliberative agent layer for scene-conditioned planning, context-isolated skill execution, multi-stage verification, multi-modal memory, and edge-cloud collaboration. To evaluate such systems, we introduce EmbodiedWorldBench, an executable benchmark with 16 indoor, outdoor, and hybrid scenes, four difficulty levels, and over 200 tasks involving navigation, object search, NPC dialogue, dynamic events, and trace-grounded scoring. ABot-AgentOS further introduces Universal Multi-modal Graph Memory, a persistent source-grounded substrate that converts dialogue, visual observations, spatial context, temporal relations, and task traces into typed nodes and edges. A failure-driven self-evolution loop converts diagnosed memory failures into gated runtime evo-assets that are promoted only to later evaluation splits, preventing current-split ground-truth leakage while enabling continual improvement. On an initial EmbodiedWorldBench subset, ABot-AgentOS improves over a single-controller baseline in both task success and goal completion. Across memory benchmarks, ABot-AgentOS Static achieves 87.5 on LoCoMo, 59.9 on OpenEQA EM-EQA, 88.6 on Mem-Gallery, and 76.5 Acc@All on NExT-QA; self-evolution further improves LoCoMo to 88.7, OpenEQA to 60.4, and Mem-Gallery to 89.0. These results suggest that a general Agent OS layer can improve long-horizon embodied execution while providing persistent, auditable memory for continual interaction.
PDF681July 15, 2026