ChatPaper.aiChatPaper

Relatório Técnico do Qwen-RobotNav: Um Modelo de Navegação Escalável Projetado para um Sistema de Navegação com Agente

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

June 18, 2026
Autores: Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Zhibo Yang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen
cs.AI

Resumo

Sistemas de navegação agentivos exigem um modelo base de navegação cuja estratégia de observação possa ser externamente reconfigurada no momento da inferência, pois o seguimento de instruções, a busca de objetos, o rastreamento de alvos e a direção autônoma compartilham a mesma base de percepção e planejamento, mas demandam estratégias fundamentalmente diferentes para consumir o fluxo visual. Apresentamos o Qwen-RobotNav, um modelo de navegação escalável construído sobre o Qwen-RobotNav que aborda essa questão por meio de uma interface parametrizada com duas dimensões complementares: múltiplos modos de tarefa que selecionam o comportamento de navegação, e parâmetros de observação controláveis (ex.: orçamento de tokens, pesos por câmera) que regulam como o histórico visual é codificado. Com randomização durante o treinamento sobre todos os parâmetros, o Qwen-RobotNav é robusto a qualquer configuração de inferência, sem exigir nenhuma modificação arquitetural na base do Qwen-RobotNav. Treinamos o Qwen-RobotNav em 15,6 milhões de amostras; o co-treinamento com dados de visão-linguagem evita o colapso em mapeadores reativos de sequências de ações observado no treinamento apenas com trajetórias. A interface parametrizada também torna o Qwen-RobotNav um bloco natural para sistemas agentivos: para cenários de longo horizonte, um planejador de nível superior decompõe objetivos em sub-tarefas e alterna dinamicamente o modo de tarefa e a estratégia de contexto do Qwen-RobotNav no meio do episódio, compondo comportamentos complexos a partir de chamadas repetidas ao mesmo modelo. Extensos experimentos mostram que o Qwen-RobotNav estabelece novos resultados de estado da arte nos principais benchmarks de navegação. O modelo exibe um escalonamento favorável de 2B para 8B parâmetros, com treinamento conjunto em múltiplas tarefas desenvolvendo um substrato compartilhado de planejamento espacial que se transfere entre famílias de tarefas, e demonstra forte generalização zero-shot para robôs do mundo real em diversos ambientes.
English
Agentic navigation systems require a base navigation model whose observation strategy can be externally reconfigured at inference time, because instruction following, object search, target tracking, and autonomous driving share the same perception-planning backbone yet demand fundamentally different strategies for consuming the visual stream. We present Qwen-RobotNav, a scalable navigation model built on Qwen-RobotNav that addresses it through a parameterised interface with two complementary dimensions: multiple task modes that select the navigation behaviour, and controllable observation parameters (e.g., token budget, per-camera weights) that govern how visual history is encoded. With training-time randomization over all parameters, Qwen-RobotNav is robust to any inference-time configuration requiring zero architectural modification to the Qwen-RobotNav backbone. We train Qwen-RobotNav on 15.6M samples; co-training with vision-language data prevents the collapse into reactive action-sequence mappers observed in trajectory-only training. The parameterised interface also makes Qwen-RobotNav a natural building block for agentic systems: for long-horizon scenarios, an upper-level planner decomposes goals into sub-tasks and dynamically switches Qwen-RobotNav's task mode and context strategy mid-episode, composing complex behaviours from repeated calls to the same model. Extensive experiments show that Qwen-RobotNav sets new state-of-the-art results across major navigation benchmarks. The model exhibits favourable scaling from 2B to 8B parameters, with joint multi-task training developing a shared spatial-planning substrate that transfers across task families, and demonstrates strong zero-shot generalisation to real-world robots across diverse environments.