3D HAMSTER: Overbruggen van planning en controle in hiërarchische visie-taal-actiemodellen door middel van 3D-trajectoriesturing
3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
June 30, 2026
Auteurs: Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo
cs.AI
Samenvatting
Hiërarchische Vision-Language-Action (VLA) modellen ontkoppelen planning op hoog niveau van besturing op laag niveau om generalisatie in robotmanipulatie te verbeteren. Recent werk binnen dit paradigma gebruikt 2D-eindeffector-trajectorieën voorspeld door een Vision-Language Model (VLM) als expliciete begeleiding voor een downstream beleid. Echter, state-of-the-art beleid op laag niveau werkt in 3D-metrische ruimte op puntenwolken, en het voeden ervan met 2D-begeleiding die diepte mist, dwingt elk waypoint de diepte toegewezen te krijgen van het scèneoppervlak dat eronder ligt, wat geometrisch vervormde trajectorieën oplevert. Wij stellen 3D HAMSTER voor, een hiërarchisch raamwerk dat deze kloof overbrugt door de planner direct metrisch betrouwbare 3D-trajectorieën te laten uitvoeren. We breiden een VLM uit met een speciale diepte-encoder en een dichte dieptereconstructiedoelstelling om 3D-waypoint-reeksen te voorspellen, die direct worden geïntegreerd in een op puntenwolken gebaseerd beleid op laag niveau. Over 3D-trajectorievoorspelling, simulatie en manipulatie in de echte wereld heen, presteert 3D HAMSTER consistent beter dan propriëtaire VLM's en 2D-gestuurde basislijnen, met de grootste winst onder uiterlijkveranderende verschuivingen en ongeziene taal-, ruimtelijke en visuele omstandigheden. De projectpagina is beschikbaar op https://davian-robotics.github.io/3D_HAMSTER/.
English
Hierarchical Vision-Language-Action (VLA) models decouple high-level planning from low-level control to improve generalization in robot manipulation. Recent work in this paradigm uses 2D end-effector trajectories predicted by a Vision-Language Model (VLM) as explicit guidance for a downstream policy. However, state-of-the-art low-level policies operate in 3D metric space on point clouds, and feeding them 2D guidance that lacks depth forces each waypoint to be assigned the depth of whatever scene surface lies beneath it, producing geometrically distorted trajectories. We propose 3D HAMSTER, a hierarchical framework that closes this gap by having the planner directly output metrically reliable 3D trajectories. We augment a VLM with a dedicated depth encoder and a dense depth reconstruction objective to predict 3D waypoint sequences, which are directly integrated into a pointcloudbased low-level policy. Across 3D trajectory prediction, simulation, and real-world manipulation, 3D HAMSTER consistently outperforms proprietary VLMs and 2D-guided baselines, with the largest gains under appearance-altering shifts and unseen language, spatial, and visual conditions. The project page is available at https://davian-robotics.github.io/3D_HAMSTER/.