ChatPaper.aiChatPaper

Qwen-RobotNav Technisch Rapport: Een schaalbaar navigatiemodel ontworpen voor een agentisch navigatiesysteem

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

June 18, 2026
Auteurs: Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Zhibo Yang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen
cs.AI

Samenvatting

Agentische navigatiesystemen vereisen een basisnavigatiemodel waarvan de observatiestrategie tijdens inferentie extern kan worden geherconfigureerd, omdat instructievolgen, objectzoeken, doelvolgen en autonoom rijden dezelfde perceptie-planningsbackbone delen, maar fundamenteel verschillende strategieën vereisen voor het verwerken van de visuele stroom. We presenteren Qwen-RobotNav, een schaalbaar navigatiemodel gebaseerd op Qwen-RobotNav dat dit aanpakt via een geparametriseerde interface met twee complementaire dimensies: meerdere taakmodi die het navigatiegedrag selecteren, en controleerbare observatieparameters (bijv. tokenbudget, gewichten per camera) die bepalen hoe de visuele geschiedenis wordt gecodeerd. Door randomisatie tijdens training over alle parameters is Qwen-RobotNav robuust voor elke configuratie tijdens inferentie, zonder dat er architectuuraanpassingen aan de Qwen-RobotNav-backbone nodig zijn. We trainen Qwen-RobotNav op 15,6 miljoen samples; gezamenlijke training met visueel-taalkundige data voorkomt het ineenstorten tot reactieve actievolgorde-mappers zoals waargenomen bij trajectorie-only training. De geparametriseerde interface maakt Qwen-RobotNav ook een natuurlijke bouwsteen voor agentische systemen: voor lange-termijnscenario's splitst een planner op hoger niveau doelen op in subtaken en schakelt dynamisch de taakmodus en contextstrategie van Qwen-RobotNav halverwege een episode om, waardoor complex gedrag wordt samengesteld uit herhaalde aanroepen van hetzelfde model. Uitgebreide experimenten tonen aan dat Qwen-RobotNav nieuwe state-of-the-art resultaten behaalt op belangrijke navigatiebenchmarks. Het model vertoont gunstige schaling van 2B naar 8B parameters, waarbij gezamenlijke multi-taak training een gedeeld ruimtelijk-planningssubstraat ontwikkelt dat overdraagt tussen taakfamilies, en vertoont sterke zero-shot generalisatie naar robotten in de echte wereld in diverse omgevingen.
English
Agentic navigation systems require a base navigation model whose observation strategy can be externally reconfigured at inference time, because instruction following, object search, target tracking, and autonomous driving share the same perception-planning backbone yet demand fundamentally different strategies for consuming the visual stream. We present Qwen-RobotNav, a scalable navigation model built on Qwen-RobotNav that addresses it through a parameterised interface with two complementary dimensions: multiple task modes that select the navigation behaviour, and controllable observation parameters (e.g., token budget, per-camera weights) that govern how visual history is encoded. With training-time randomization over all parameters, Qwen-RobotNav is robust to any inference-time configuration requiring zero architectural modification to the Qwen-RobotNav backbone. We train Qwen-RobotNav on 15.6M samples; co-training with vision-language data prevents the collapse into reactive action-sequence mappers observed in trajectory-only training. The parameterised interface also makes Qwen-RobotNav a natural building block for agentic systems: for long-horizon scenarios, an upper-level planner decomposes goals into sub-tasks and dynamically switches Qwen-RobotNav's task mode and context strategy mid-episode, composing complex behaviours from repeated calls to the same model. Extensive experiments show that Qwen-RobotNav sets new state-of-the-art results across major navigation benchmarks. The model exhibits favourable scaling from 2B to 8B parameters, with joint multi-task training developing a shared spatial-planning substrate that transfers across task families, and demonstrates strong zero-shot generalisation to real-world robots across diverse environments.