ABot-N1: Hacia un modelo fundacional general de navegación visual-lenguaje

ABot-N1: Toward a General Visual Language Navigation Foundation Model

July 11, 2026
Autores: Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Zedong Chu, Xiaolong Wu, Mu Xu
cs.AI

Resumen

Los modelos fundacionales de navegación por lenguaje visual tienen como objetivo unificar el razonamiento profundo para decisiones espaciales fundamentadas con una amplia versatilidad para diversas tareas encarnadas. Los enfoques actuales suelen lograr esta integración mediante políticas monolíticas que mapean directamente las observaciones en acciones, pero a menudo sufren de deriva de coordenadas y un manejo deficiente de semánticas de cola larga. Además, estos mapeos de caja negra carecen de interpretabilidad, lo que dificulta alcanzar simultáneamente generalidad, robustez y transparencia. Presentamos ABot-N1, un paso hacia un modelo fundacional general de navegación por lenguaje visual, que aborda estos desafíos desacoplando la cognición del control mediante una arquitectura lento-rápido guiada por señales duales de lenguaje visual. Más específicamente, un razonador lento de lenguaje visual realiza un razonamiento explícito de Cadena de Pensamiento mientras produce un objetivo de píxel. Este conjunto compacto de puntos de anclaje en el espacio de imagen sirve como interfaz universal para diversas tareas, incluyendo objetivo-punto, objetivo-objeto, objetivo-POI, seguimiento de instrucciones y seguimiento de personas. Posteriormente, un experto en acciones rápido aprovecha tanto las señales textuales como la guía de píxeles para generar puntos de ruta continuos a la frecuencia de control nativa. Al tender puentes entre las intenciones de alto nivel y el control de bajo nivel mediante anclajes basados en píxeles emparejados con trazas lingüísticas explícitas, nuestro enfoque garantiza una navegación robusta, generalizable e interpretable en simulaciones y puntos de referencia del mundo real. ABot-N1 establece nuevos récords de última generación, generando ganancias masivas específicamente en navegación a escala urbana: aumenta la llegada a POI en un 35,0% (hasta el 77,3%) y logra un 95,4%/92,9% de SR en escenas interiores y exteriores complejas. También mantiene una robustez superior en tareas de alcance de objetos, seguimiento de personas y seguimiento de instrucciones. Se publican como código abierto nuevos puntos de referencia de Objetivo-Punto/Objetivo-POI para avanzar en el campo de la navegación a escala urbana.
English
Visual Language Navigation foundation models aim to unify deep reasoning for grounded spatial decisions with broad versatility for diverse embodied tasks. Current approaches typically achieve this integration via monolithic policies that map observations directly to actions, yet they often suffer from coordinate drift and poor handling of long-tail semantics. Furthermore, these black-box mappings lack interpretability, hindering the simultaneous achievement of generality, robustness, and transparency. We present ABot-N1, a step toward a general Visual Language Navigation foundation model, that addresses these challenges by decoupling cognition from control via a slow-fast architecture guided by dual visual-language signals. More specifically, a slow vision-language reasoner performs explicit Chain-of-Thought reasoning while producing a pixel goal. This compact set of image-space anchor points serves as a universal interface for diverse tasks, including point-goal, object-goal, poi-goal, instruction-following, and person-following. Subsequently, a fast action expert leverages both the textual cues and the pixel guidance to generate continuous waypoints at the native control frequency. By bridging high-level intents and low-level control through pixel-grounded anchors paired with explicit linguistic traces, our approach ensures robust, generalizable, and interpretable navigation across simulation and real-world benchmarks. ABot-N1 establishes new state-of-the-art records, delivering massive gains specifically in urban-scale navigation: boosting POI arrival by 35.0% (to 77.3%) and achieving 95.4%/92.9% SR in complex indoor and outdoor scenes. It also maintains superior robustness across object-reaching, person-following, and instruction-following tasks. New Point-Goal/POI-Goal benchmarks are released as open source to advance the field of urban-scale navigation.
PDF811July 15, 2026