TANGO: 전신 비전-언어-행동 모델을 이용한 복잡한 환경에서의 휴머노이드 내비게이션
TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model
September 8, 2026
저자: Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren, Masayoshi Tomizuka, Dhruv Shah
cs.AI
초록
우리는 휴머노이드 로봇으로 장애물이 많은 실내 환경을 내비게이션하는 문제를 연구한다. 내비게이션을 2D 경로 계획 문제로 모델링하는 기존 방법과 달리, 장애물이 많은 환경에서의 휴머노이드 이동은 복잡한 3D 공간을 충돌 없이 통과하기 위한 협응된 팔 배치, 몸통 조정, 보행 조절을 포함하는 연속적인 기하학 인식 전신 적응을 요구한다. 우리는 TANGO를 소개한다. TANGO는 장애물이 많은 환경에서 언어 조건부 휴머노이드 이동을 위한 최초의 전신 비전-언어 내비게이션 프레임워크이다. 자연어 지시와 자기중심 RGB 관측이 주어지면, TANGO는 다운스트림 전신 제어를 위한 29 자유도 관절 공간 행동을 직접 예측한다. 우리는 전역 경로 계획, 기구학적 전신 동작 생성, 장애물 인식 모션 편집, RL 기반 추적을 통해 다양한 충돌 없는 이동 행동을 합성함으로써 TANGO를 전적으로 시뮬레이션에서 학습한다. 이 파이프라인은 언어 조건부 전신 정책을 학습하기 위한 동역학적으로 실현 가능한 행동 지도 신호를 제공한다. 광범위한 시뮬레이션 실험에서 TANGO는 비전-언어 내비게이션에서 최첨단 성능을 보여주며, 장애물 극복이 필요한 도전적인 장면을 내비게이션하는 데 있어 강력한 모듈형 베이스라인을 능가한다. 마지막으로, 우리는 TANGO를 Unitree G1 휴머노이드 로봇에 제로샷으로 배포하고, 실제 환경 내비게이션 데이터로 전혀 학습하지 않고도 장애물이 많은 실제 장면에서 강건한 언어 유도 이동을 관찰한다.
English
We study the problem of navigating cluttered indoor environments with a humanoid robot. Unlike conventional methods that model navigation as a 2D path planning problem, humanoid traversal in cluttered environments requires continuous geometry-aware whole-body adaptation, including coordinated arm placement, torso adjustment, and gait modulation for collision-free movement through complex 3D spaces. We introduce TANGO, the first whole-body vision-language navigation framework for language-conditioned humanoid traversal in cluttered environments. Given a natural-language instruction and egocentric RGB observations, TANGO directly predicts 29-DoF joint-space actions for downstream whole-body control. We train TANGO entirely in simulation by synthesizing diverse collision-free traversal behaviors via global path planning, kinematic whole-body motion generation, obstacle-aware motion editing, and RL-based tracking. This pipeline provides dynamically feasible action supervision for learning language-conditioned whole-body policies. In extensive simulation experiments, TANGO demonstrates state-of-the-art performance in vision-language navigation, while outperforming strong modular baselines in navigating challenging scenes requiring obstacle negotiation. Lastly, we deploy TANGO zero-shot on a Unitree G1 humanoid robot, and observe robust language-guided traversal in cluttered real-world scenes without training on any real-world navigation data.