ChatPaper.aiChatPaper

TANGO: 全身視覚-言語-行動モデルによる雑然とした環境でのヒューマノイドナビゲーション

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

September 8, 2026
著者: Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren, Masayoshi Tomizuka, Dhruv Shah
cs.AI

要旨

我々は、ヒューマノイドロボットを用いて雑然とした屋内環境をナビゲートする問題を研究する。ナビゲーションを2次元経路計画問題としてモデル化する従来手法とは異なり、雑然とした環境におけるヒューマノイド移動には、複雑な3次元空間を衝突なく移動するための、腕配置の協調、胴体調整、歩容変調を含む、幾何情報を考慮した連続的な全身適応が必要である。我々はTANGOを導入する。これは、雑然とした環境における言語条件付きヒューマノイド移動のための初の全身視覚言語ナビゲーション枠組みである。自然言語指示と自己中心RGB観測が与えられると、TANGOは下流の全身制御向けに29自由度の関節空間行動を直接予測する。我々は、大域経路計画、キネマティックな全身動作生成、障害物を考慮した動作編集、RLに基づくトラッキングによって多様な衝突のない移動行動を合成することにより、TANGOを完全にシミュレーション内で訓練する。このパイプラインは、言語条件付き全身方策を学習するための動的に実行可能な行動教師を提供する。広範なシミュレーション実験において、TANGOは視覚言語ナビゲーションで最先端性能を示す一方、障害物対処を要する困難なシーンでのナビゲーションにおいて強力なモジュール型ベースラインを上回る。最後に、我々はTANGOをUnitree G1ヒューマノイドロボット上にゼロショットで展開し、実世界のナビゲーションデータで一切訓練することなく、雑然とした実世界シーンにおいて頑健な言語誘導移動を観測する。
English
We study the problem of navigating cluttered indoor environments with a humanoid robot. Unlike conventional methods that model navigation as a 2D path planning problem, humanoid traversal in cluttered environments requires continuous geometry-aware whole-body adaptation, including coordinated arm placement, torso adjustment, and gait modulation for collision-free movement through complex 3D spaces. We introduce TANGO, the first whole-body vision-language navigation framework for language-conditioned humanoid traversal in cluttered environments. Given a natural-language instruction and egocentric RGB observations, TANGO directly predicts 29-DoF joint-space actions for downstream whole-body control. We train TANGO entirely in simulation by synthesizing diverse collision-free traversal behaviors via global path planning, kinematic whole-body motion generation, obstacle-aware motion editing, and RL-based tracking. This pipeline provides dynamically feasible action supervision for learning language-conditioned whole-body policies. In extensive simulation experiments, TANGO demonstrates state-of-the-art performance in vision-language navigation, while outperforming strong modular baselines in navigating challenging scenes requiring obstacle negotiation. Lastly, we deploy TANGO zero-shot on a Unitree G1 humanoid robot, and observe robust language-guided traversal in cluttered real-world scenes without training on any real-world navigation data.