ABot-N1: Rumo a um Modelo Fundacional Geral de Navegação por Linguagem Visual
ABot-N1: Toward a General Visual Language Navigation Foundation Model
July 11, 2026
Autores: Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Zedong Chu, Xiaolong Wu, Mu Xu
cs.AI
Resumo
Modelos fundamentais de Navegação por Linguagem Visual visam unificar o raciocínio profundo para decisões espaciais fundamentadas com ampla versatilidade para diversas tarefas incorporadas. Abordagens atuais geralmente alcançam essa integração por meio de políticas monolíticas que mapeiam observações diretamente para ações; no entanto, frequentemente sofrem de desvio de coordenadas e tratamento inadequado de semânticas de cauda longa. Além disso, esses mapeamentos de caixa-preta carecem de interpretabilidade, dificultando a obtenção simultânea de generalidade, robustez e transparência. Apresentamos o ABot-N1, um passo em direção a um modelo fundamental geral de Navegação Visual-Linguística, que aborda esses desafios ao desacoplar cognição de controle por meio de uma arquitetura lento-rápido guiada por sinais duais de visão-linguagem. Mais especificamente, um raciocinador lento de visão-linguagem realiza raciocínio explícito em Cadeia de Pensamento enquanto produz um objetivo de pixel. Esse conjunto compacto de pontos de ancoragem no espaço da imagem serve como uma interface universal para diversas tarefas, incluindo objetivo de ponto, objetivo de objeto, objetivo de POI, seguimento de instruções e seguimento de pessoa. Posteriormente, um especialista rápido em ações aproveita tanto as pistas textuais quanto a orientação de pixel para gerar waypoints contínuos na frequência de controle nativa. Ao conectar intenções de alto nível e controle de baixo nível por meio de âncoras fundamentadas em pixel pareadas com traços linguísticos explícitos, nossa abordagem garante navegação robusta, generalizável e interpretável em benchmarks de simulação e mundo real. O ABot-N1 estabelece novos recordes de estado-da-arte, proporcionando ganhos massivos especificamente em navegação em escala urbana: aumentando a chegada a POIs em 35,0% (para 77,3%) e alcançando 95,4%/92,9% de SR em cenas internas e externas complexas. Ele também mantém robustez superior em tarefas de alcance de objetos, seguimento de pessoa e seguimento de instruções. Novos benchmarks de Point-Goal/POI-Goal são disponibilizados como código aberto para avançar o campo da navegação em escala urbana.
English
Visual Language Navigation foundation models aim to unify deep reasoning for grounded spatial decisions with broad versatility for diverse embodied tasks. Current approaches typically achieve this integration via monolithic policies that map observations directly to actions, yet they often suffer from coordinate drift and poor handling of long-tail semantics. Furthermore, these black-box mappings lack interpretability, hindering the simultaneous achievement of generality, robustness, and transparency. We present ABot-N1, a step toward a general Visual Language Navigation foundation model, that addresses these challenges by decoupling cognition from control via a slow-fast architecture guided by dual visual-language signals. More specifically, a slow vision-language reasoner performs explicit Chain-of-Thought reasoning while producing a pixel goal. This compact set of image-space anchor points serves as a universal interface for diverse tasks, including point-goal, object-goal, poi-goal, instruction-following, and person-following. Subsequently, a fast action expert leverages both the textual cues and the pixel guidance to generate continuous waypoints at the native control frequency. By bridging high-level intents and low-level control through pixel-grounded anchors paired with explicit linguistic traces, our approach ensures robust, generalizable, and interpretable navigation across simulation and real-world benchmarks. ABot-N1 establishes new state-of-the-art records, delivering massive gains specifically in urban-scale navigation: boosting POI arrival by 35.0% (to 77.3%) and achieving 95.4%/92.9% SR in complex indoor and outdoor scenes. It also maintains superior robustness across object-reaching, person-following, and instruction-following tasks. New Point-Goal/POI-Goal benchmarks are released as open source to advance the field of urban-scale navigation.