ABot-AgentOS: Um Sistema Operacional de Agente Robótico Geral com Memória Multimodal Vitalícia
ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
July 11, 2026
Autores: Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Mingyang Yin, Zedong Chu, Mu Xu
cs.AI
Resumo
Sistemas recentes de VLM e VLA melhoraram a percepção robótica e a previsão de ações, no entanto, agentes incorporados de longo horizonte ainda necessitam de uma camada de tempo de execução geral para raciocínio, memória, uso de ferramentas, verificação e execução entre diferentes corpos. Apresentamos o ABot-AgentOS, um Sistema Operacional de Agente robótico geral que se situa acima de controladores de baixo nível e fornece uma camada de agente deliberativa para planejamento condicionado à cena, execução de habilidades com contexto isolado, verificação em múltiplos estágios, memória multimodal e colaboração borda-nuvem. Para avaliar tais sistemas, introduzimos o EmbodiedWorldBench, um benchmark executável com 16 cenas internas, externas e híbridas, quatro níveis de dificuldade e mais de 200 tarefas envolvendo navegação, busca de objetos, diálogo com NPCs, eventos dinâmicos e pontuação fundamentada em rastros. O ABot-AgentOS também introduz a Memória Gráfica Multimodal Universal, um substrato persistente fundamentado em fonte que converte diálogo, observações visuais, contexto espacial, relações temporais e rastros de tarefas em nós e arestas tipadas. Um ciclo de autoevolução orientado por falhas converte falhas de memória diagnosticadas em ativos de evolução em tempo de execução com portões, que são promovidos apenas para divisões de avaliação posteriores, evitando vazamento de ground truth na divisão atual enquanto possibilita melhoria contínua. Em um subconjunto inicial do EmbodiedWorldBench, o ABot-AgentOS melhora uma linha de base de controlador único tanto no sucesso de tarefas quanto na conclusão de objetivos. Em benchmarks de memória, o ABot-AgentOS Static atinge 87,5 no LoCoMo, 59,9 no OpenEQA EM-EQA, 88,6 no Mem-Gallery e 76,5 Acc@All no NExT-QA; a autoevolução melhora ainda mais o LoCoMo para 88,7, o OpenEQA para 60,4 e o Mem-Gallery para 89,0. Esses resultados sugerem que uma camada geral de Sistema Operacional de Agente pode melhorar a execução incorporada de longo horizonte enquanto fornece memória persistente e auditável para interação contínua.
English
Recent VLM and VLA systems have improved robotic perception and action prediction, yet long-horizon embodied agents still require a general runtime layer for reasoning, memory, tool use, verification, and cross-embodiment execution. We present ABot-AgentOS, a general robotic Agent Operating System that sits above low-level controllers and provides a deliberative agent layer for scene-conditioned planning, context-isolated skill execution, multi-stage verification, multi-modal memory, and edge-cloud collaboration. To evaluate such systems, we introduce EmbodiedWorldBench, an executable benchmark with 16 indoor, outdoor, and hybrid scenes, four difficulty levels, and over 200 tasks involving navigation, object search, NPC dialogue, dynamic events, and trace-grounded scoring. ABot-AgentOS further introduces Universal Multi-modal Graph Memory, a persistent source-grounded substrate that converts dialogue, visual observations, spatial context, temporal relations, and task traces into typed nodes and edges. A failure-driven self-evolution loop converts diagnosed memory failures into gated runtime evo-assets that are promoted only to later evaluation splits, preventing current-split ground-truth leakage while enabling continual improvement. On an initial EmbodiedWorldBench subset, ABot-AgentOS improves over a single-controller baseline in both task success and goal completion. Across memory benchmarks, ABot-AgentOS Static achieves 87.5 on LoCoMo, 59.9 on OpenEQA EM-EQA, 88.6 on Mem-Gallery, and 76.5 Acc@All on NExT-QA; self-evolution further improves LoCoMo to 88.7, OpenEQA to 60.4, and Mem-Gallery to 89.0. These results suggest that a general Agent OS layer can improve long-horizon embodied execution while providing persistent, auditable memory for continual interaction.