ABot-N1: К общей фундаментальной модели визуально-языковой навигации

ABot-N1: Toward a General Visual Language Navigation Foundation Model

July 11, 2026
Авторы: Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Zedong Chu, Xiaolong Wu, Mu Xu
cs.AI

Аннотация

Фундаментальные модели визуально-языковой навигации (Visual Language Navigation) направлены на объединение глубокого рассуждения для пространственных решений с широкой универсальностью, необходимой для разнообразных воплощённых задач. Современные подходы обычно реализуют такую интеграцию с помощью монолитных политик, отображающих наблюдения непосредственно в действия, однако они часто страдают от дрейфа координат и плохой обработки длиннохвостовой семантики. Кроме того, такие отображения, работающие по принципу «чёрного ящика», лишены интерпретируемости, что препятствует одновременному достижению обобщённости, надёжности и прозрачности. Мы представляем ABot-N1 — шаг в сторону общей фундаментальной модели визуально-языковой навигации, которая решает эти проблемы путём разделения когнитивных процессов и управления с помощью медленно-быстрой архитектуры, направляемой двойными визуально-языковыми сигналами. В частности, медленный визуально-языковой рассуждатель выполняет явное рассуждение по цепочке мыслей (Chain-of-Thought), одновременно формируя пиксельную цель. Этот компактный набор опорных точек в пространстве изображения служит универсальным интерфейсом для различных задач, включая достижение целевой точки (point-goal), целевого объекта (object-goal), точки интереса (poi-goal), следование инструкциям (instruction-following) и следование за человеком (person-following). Впоследствии быстрый эксперт по действиям использует как текстовые подсказки, так и пиксельное управление для генерации непрерывных путевых точек на собственной частоте управления. Связывая высокоуровневые намерения и низкоуровневое управление через пиксельные привязки в сочетании с явными лингвистическими следами, наш подход обеспечивает надёжную, обобщаемую и интерпретируемую навигацию как в симуляции, так и на реальных эталонных тестах. ABot-N1 устанавливает новые рекорды, достигая значительных улучшений в навигации городского масштаба: повышение точности прибытия в точку интереса (POI) на 35,0% (до 77,3%) и достижение успешности (SR) 95,4%/92,9% в сложных indoor- и outdoor-сценах. Модель также сохраняет превосходную надёжность в задачах достижения объектов, следования за человеком и следования инструкциям. Новые эталонные тесты Point-Goal/POI-Goal публикуются в открытом доступе для продвижения области навигации городского масштаба.
English
Visual Language Navigation foundation models aim to unify deep reasoning for grounded spatial decisions with broad versatility for diverse embodied tasks. Current approaches typically achieve this integration via monolithic policies that map observations directly to actions, yet they often suffer from coordinate drift and poor handling of long-tail semantics. Furthermore, these black-box mappings lack interpretability, hindering the simultaneous achievement of generality, robustness, and transparency. We present ABot-N1, a step toward a general Visual Language Navigation foundation model, that addresses these challenges by decoupling cognition from control via a slow-fast architecture guided by dual visual-language signals. More specifically, a slow vision-language reasoner performs explicit Chain-of-Thought reasoning while producing a pixel goal. This compact set of image-space anchor points serves as a universal interface for diverse tasks, including point-goal, object-goal, poi-goal, instruction-following, and person-following. Subsequently, a fast action expert leverages both the textual cues and the pixel guidance to generate continuous waypoints at the native control frequency. By bridging high-level intents and low-level control through pixel-grounded anchors paired with explicit linguistic traces, our approach ensures robust, generalizable, and interpretable navigation across simulation and real-world benchmarks. ABot-N1 establishes new state-of-the-art records, delivering massive gains specifically in urban-scale navigation: boosting POI arrival by 35.0% (to 77.3%) and achieving 95.4%/92.9% SR in complex indoor and outdoor scenes. It also maintains superior robustness across object-reaching, person-following, and instruction-following tasks. New Point-Goal/POI-Goal benchmarks are released as open source to advance the field of urban-scale navigation.
PDF811July 15, 2026