LightNav-0:激发视觉语言模型空间智能以实现通用具身导航
LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
August 31, 2026
作者: Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan
cs.AI
摘要
具身导航要求智能体在异构目标与视觉观测之间建立映射,并据此在不同任务、环境和机器人形态中生成动作。现代视觉-语言模型(VLM)已编码了用于视觉定位、空间推理和指向的空间先验,但这些能力很少被直接激发用于机器人控制。现有导航系统反而依赖任务或形态特定的组件,将感知、推理与动作割裂开来,且泛化能力有限。为此,我们提出LightNav-0,一种紧凑型通用具身导航模型,它激发预训练VLM的空间智能并将其与导航对齐,无需任务特定的预测头。LightNav-0通过统一的标记接口表征多样化的导航任务:双通道指向表达与任务、场景和形态无关的空间意图,而残差向量量化动作分词器将该意图映射为精确的、形态特定的轨迹。结合时间感知的视觉历史压缩、ER中期训练、监督微调和强化学习,该框架在单一模型中同时支持指令跟随、开放词汇目标导航和视觉跟踪。导航训练语料库涵盖2000余个场景和4000余小时的具身导航数据。用于初始化LightNav-0的具身推理检查点LightNav-ER在8个具身推理基准上取得了最高的完整集合平均值,而LightNav-0在全部10个公开导航仿真设置中实现了最优的单目成功率。真实世界评估进一步证明了其在机器人形态、多样场景以及静态和动态目标上的零样本泛化能力。这些结果确立了紧凑型VLM作为通用具身导航统一且可迁移骨干网络的可行性。
English
Embodied navigation requires agents to translate heterogeneous goals and visual observations into actions across tasks, environments, and robot embodiments. Modern vision-language models (VLMs) already encode spatial priors for visual grounding, spatial reasoning, and pointing, but these capabilities are rarely elicited directly for robot control. Existing navigation systems instead rely on task- or embodiment-specific components, fragmenting perception, reasoning, and action while offering limited generalization. Here we present LightNav-0, a compact generalist embodied navigation model that elicits the spatial intelligence of a pretrained VLM and aligns it with navigation, without task-specific prediction heads. LightNav-0 represents diverse navigation tasks through a unified token interface: dual-channel pointing expresses task-, scene-, and embodiment-agnostic spatial intent, while a residual vector-quantized action tokenizer maps this intent to precise, embodiment-specific trajectories. Together with temporally aware visual history compression, ER mid-training, supervised fine-tuning, and reinforcement learning, this formulation supports instruction following, open-vocabulary object navigation, and visual tracking within a single model. The navigation training corpus spans 2K+ scenes and 4K+ hours of embodied navigation data. LightNav-ER, the embodied-reasoning checkpoint used to initialize LightNav-0, attains the highest complete-set average across 8 embodied-reasoning benchmarks, while LightNav-0 achieves state-of-the-art monocular success rates across all 10 public navigation simulation settings. Real-world evaluations further demonstrate zero-shot generalization across robot embodiments, diverse scenes, and static and dynamic targets. These results establish compact VLMs as a unified and transferable backbone for generalist embodied navigation.