ABot-N1: Auf dem Weg zu einem allgemeinen visuellen Sprachnavigations-Foundation-Modell
ABot-N1: Toward a General Visual Language Navigation Foundation Model
July 11, 2026
Autoren: Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Zedong Chu, Xiaolong Wu, Mu Xu
cs.AI
Zusammenfassung
Grundlagenmodelle für visuelle Sprachnavigation zielen darauf ab, tiefgehendes Denken für fundierte räumliche Entscheidungen mit einer breiten Vielseitigkeit für verschiedene verkörperte Aufgaben zu vereinen. Aktuelle Ansätze erreichen diese Integration in der Regel durch monolithische Strategien, die Beobachtungen direkt in Aktionen umwandeln, leiden jedoch häufig unter Koordinatendrift und einer schlechten Handhabung von Long-Tail-Semantiken. Darüber hinaus mangelt es diesen Black-Box-Abbildungen an Interpretierbarkeit, was die gleichzeitige Erreichung von Allgemeingültigkeit, Robustheit und Transparenz behindert. Wir stellen ABot-N1 vor, einen Schritt in Richtung eines allgemeinen Grundlagenmodells für visuelle Sprachnavigation, das diese Herausforderungen angeht, indem es Kognition von Steuerung durch eine langschnelle Architektur entkoppelt, die von dualen visuell-sprachlichen Signalen geleitet wird. Genauer gesagt führt ein langsamer visuell-sprachlicher Denker explizites Chain-of-Thought-Denken durch, während er ein Pixelziel erzeugt. Diese kompakte Menge von Ankerpunkten im Bildraum dient als universelle Schnittstelle für verschiedene Aufgaben, darunter Punktziel, Objektziel, POI-Ziel, Anweisungsbefolgung und Personenfolgen. Anschließend nutzt ein schneller Aktionsspezialist sowohl die textuellen Hinweise als auch die Pixelanleitung, um kontinuierliche Wegpunkte mit der nativen Steuerfrequenz zu generieren. Durch die Verbindung von Absichten auf hoher Ebene mit niedriger Steuerung über pixelverankerte Ankerpunkte, die mit expliziten sprachlichen Spuren gepaart sind, gewährleistet unser Ansatz eine robuste, verallgemeinerbare und interpretierbare Navigation über Simulationen und reale Benchmarks hinweg. ABot-N1 stellt neue Spitzenwerte auf und erzielt insbesondere bei der Navigation im städtischen Maßstab massive Verbesserungen: Steigerung der POI-Ankunft um 35,0 % (auf 77,3 %) und Erreichen von 95,4 %/92,9 % SR in komplexen Innen- und Außenszenen. Es behält zudem eine überlegene Robustheit bei Aufgaben des Objekterreichens, Personenfolgens und Anweisungsbefolgens bei. Neue Point-Goal/POI-Goal-Benchmarks werden als Open Source veröffentlicht, um das Gebiet der Navigation im städtischen Maßstab voranzubringen.
English
Visual Language Navigation foundation models aim to unify deep reasoning for grounded spatial decisions with broad versatility for diverse embodied tasks. Current approaches typically achieve this integration via monolithic policies that map observations directly to actions, yet they often suffer from coordinate drift and poor handling of long-tail semantics. Furthermore, these black-box mappings lack interpretability, hindering the simultaneous achievement of generality, robustness, and transparency. We present ABot-N1, a step toward a general Visual Language Navigation foundation model, that addresses these challenges by decoupling cognition from control via a slow-fast architecture guided by dual visual-language signals. More specifically, a slow vision-language reasoner performs explicit Chain-of-Thought reasoning while producing a pixel goal. This compact set of image-space anchor points serves as a universal interface for diverse tasks, including point-goal, object-goal, poi-goal, instruction-following, and person-following. Subsequently, a fast action expert leverages both the textual cues and the pixel guidance to generate continuous waypoints at the native control frequency. By bridging high-level intents and low-level control through pixel-grounded anchors paired with explicit linguistic traces, our approach ensures robust, generalizable, and interpretable navigation across simulation and real-world benchmarks. ABot-N1 establishes new state-of-the-art records, delivering massive gains specifically in urban-scale navigation: boosting POI arrival by 35.0% (to 77.3%) and achieving 95.4%/92.9% SR in complex indoor and outdoor scenes. It also maintains superior robustness across object-reaching, person-following, and instruction-following tasks. New Point-Goal/POI-Goal benchmarks are released as open source to advance the field of urban-scale navigation.