ABot-N1: Naar een algemeen fundatiemodel voor visuele-taalnavigatie
ABot-N1: Toward a General Visual Language Navigation Foundation Model
July 11, 2026
Auteurs: Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Zedong Chu, Xiaolong Wu, Mu Xu
cs.AI
Samenvatting
Fundamentmodellen voor visuele taalnavigatie streven ernaar diepgaand redeneren voor ruimtelijke beslissingen te verenigen met brede veelzijdigheid voor diverse belichaamde taken. Huidige benaderingen bereiken deze integratie doorgaans via monolithische beleidsregels die waarnemingen direct naar acties vertalen, maar ze lijden vaak onder coördinatendrift en slechte omgang met langstaartsemantiek. Bovendien missen deze black-box-vertalingen interpreteerbaarheid, wat het gelijktijdig bereiken van algemeenheid, robuustheid en transparantie belemmert. We presenteren ABot-N1, een stap richting een algemeen funderingsmodel voor visuele taalnavigatie, dat deze uitdagingen aanpakt door cognitie te ontkoppelen van controle via een langzaam-snelle architectuur geleid door dubbele visuele-taalsignalen. Specifieker, een langzame visie-taalredenaar voert expliciete keten-van-gedachte-redenering uit terwijl het een pixeldoel produceert. Deze compacte set van ankerpunten in de beeldruimte fungeert als een universele interface voor diverse taken, waaronder punt-doel, object-doel, POI-doel, instructie-volgen en persoon-volgen. Vervolgens maakt een snelle actie-expert gebruik van zowel de tekstuele aanwijzingen als de pixelbegeleiding om continue wegpunten te genereren op de oorspronkelijke besturingsfrequentie. Door hoogwaardige intenties en laagwaardige controle te overbruggen via pixel-verankerde ankerpunten gecombineerd met expliciete linguïstische sporen, zorgt onze aanpak voor robuuste, generaliseerbare en interpreteerbare navigatie in zowel simulatie- als praktijkbenchmarks. ABot-N1 vestigt nieuwe state-of-the-art records, met name in stedelijke navigatie: een stijging van 35,0% (naar 77,3%) in POI-aankomst en 95,4%/92,9% SR in complexe binnen- en buitenscènes. Het behoudt ook superieure robuustheid bij taken zoals objectbereiken, persoon-volgen en instructie-volgen. Nieuwe Point-Goal/POI-Goal-benchmarks worden als open source vrijgegeven om het veld van stedelijke navigatie vooruit te helpen.
English
Visual Language Navigation foundation models aim to unify deep reasoning for grounded spatial decisions with broad versatility for diverse embodied tasks. Current approaches typically achieve this integration via monolithic policies that map observations directly to actions, yet they often suffer from coordinate drift and poor handling of long-tail semantics. Furthermore, these black-box mappings lack interpretability, hindering the simultaneous achievement of generality, robustness, and transparency. We present ABot-N1, a step toward a general Visual Language Navigation foundation model, that addresses these challenges by decoupling cognition from control via a slow-fast architecture guided by dual visual-language signals. More specifically, a slow vision-language reasoner performs explicit Chain-of-Thought reasoning while producing a pixel goal. This compact set of image-space anchor points serves as a universal interface for diverse tasks, including point-goal, object-goal, poi-goal, instruction-following, and person-following. Subsequently, a fast action expert leverages both the textual cues and the pixel guidance to generate continuous waypoints at the native control frequency. By bridging high-level intents and low-level control through pixel-grounded anchors paired with explicit linguistic traces, our approach ensures robust, generalizable, and interpretable navigation across simulation and real-world benchmarks. ABot-N1 establishes new state-of-the-art records, delivering massive gains specifically in urban-scale navigation: boosting POI arrival by 35.0% (to 77.3%) and achieving 95.4%/92.9% SR in complex indoor and outdoor scenes. It also maintains superior robustness across object-reaching, person-following, and instruction-following tasks. New Point-Goal/POI-Goal benchmarks are released as open source to advance the field of urban-scale navigation.