ChatPaper.aiChatPaper

3D HAMSTER : Faire le pont entre planification et contrôle dans les modèles hiérarchiques vision-langage-action via un guidage de trajectoire 3D

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

June 30, 2026
Auteurs: Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo
cs.AI

Résumé

Les modèles hiérarchiques Vision-Langage-Action (VLA) découplent la planification de haut niveau du contrôle de bas niveau pour améliorer la généralisation dans la manipulation robotique. Des travaux récents dans ce paradigme utilisent des trajectoires 2D de l’effecteur terminal prédites par un modèle Vision-Langage (VLM) comme guide explicite pour une politique aval. Cependant, les politiques de bas niveau les plus avancées opèrent dans un espace métrique 3D sur des nuages de points, et leur fournir un guidage 2D dépourvu de profondeur oblige chaque point de passage à se voir attribuer la profondeur de la surface de la scène située en dessous, produisant des trajectoires géométriquement déformées. Nous proposons 3D HAMSTER, un cadre hiérarchique qui comble cet écart en faisant en sorte que le planificateur produise directement des trajectoires 3D métriquement fiables. Nous augmentons un VLM avec un encodeur de profondeur dédié et un objectif de reconstruction dense de profondeur pour prédire des séquences de points de passage 3D, qui sont directement intégrées dans une politique de bas niveau basée sur des nuages de points. Sur les plans de la prédiction de trajectoire 3D, de la simulation et de la manipulation réelle, 3D HAMSTER surpasse systématiquement les VLM propriétaires et les approches de référence guidées en 2D, avec les gains les plus importants sous des décalages d’apparence et des conditions linguistiques, spatiales et visuelles inédites. La page du projet est disponible à l’adresse https://davian-robotics.github.io/3D_HAMSTER/.
English
Hierarchical Vision-Language-Action (VLA) models decouple high-level planning from low-level control to improve generalization in robot manipulation. Recent work in this paradigm uses 2D end-effector trajectories predicted by a Vision-Language Model (VLM) as explicit guidance for a downstream policy. However, state-of-the-art low-level policies operate in 3D metric space on point clouds, and feeding them 2D guidance that lacks depth forces each waypoint to be assigned the depth of whatever scene surface lies beneath it, producing geometrically distorted trajectories. We propose 3D HAMSTER, a hierarchical framework that closes this gap by having the planner directly output metrically reliable 3D trajectories. We augment a VLM with a dedicated depth encoder and a dense depth reconstruction objective to predict 3D waypoint sequences, which are directly integrated into a pointcloudbased low-level policy. Across 3D trajectory prediction, simulation, and real-world manipulation, 3D HAMSTER consistently outperforms proprietary VLMs and 2D-guided baselines, with the largest gains under appearance-altering shifts and unseen language, spatial, and visual conditions. The project page is available at https://davian-robotics.github.io/3D_HAMSTER/.