3D HAMSTER: Uniendo Planificación y Control en Modelos Jerárquicos de Visión-Lenguaje-Acción mediante Guía de Trayectorias 3D
3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
June 30, 2026
Autores: Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo
cs.AI
Resumen
Los modelos jerárquicos Visión-Lenguaje-Acción (VLA) separan la planificación de alto nivel del control de bajo nivel para mejorar la generalización en la manipulación robótica. Trabajos recientes en este paradigma utilizan trayectorias del efector final en 2D predichas por un Modelo de Visión-Lenguaje (VLM) como guía explícita para una política downstream. Sin embargo, las políticas de bajo nivel de última generación operan en espacio métrico 3D sobre nubes de puntos, y alimentarlas con guía en 2D que carece de profundidad obliga a asignar a cada punto de trayectoria la profundidad de la superficie de la escena que se encuentra debajo, produciendo trayectorias geométricamente distorsionadas. Proponemos 3D HAMSTER, un marco jerárquico que cierra esta brecha al hacer que el planificador genere directamente trayectorias 3D métricamente confiables. Aumentamos un VLM con un codificador de profundidad dedicado y un objetivo denso de reconstrucción de profundidad para predecir secuencias de puntos de trayectoria en 3D, que se integran directamente en una política de bajo nivel basada en nubes de puntos. En la predicción de trayectorias 3D, simulación y manipulación en el mundo real, 3D HAMSTER supera consistentemente a los VLMs propietarios y a las líneas base guiadas por 2D, con las mayores ganancias bajo cambios de apariencia y condiciones no vistas de lenguaje, espaciales y visuales. La página del proyecto está disponible en https://davian-robotics.github.io/3D_HAMSTER/.
English
Hierarchical Vision-Language-Action (VLA) models decouple high-level planning from low-level control to improve generalization in robot manipulation. Recent work in this paradigm uses 2D end-effector trajectories predicted by a Vision-Language Model (VLM) as explicit guidance for a downstream policy. However, state-of-the-art low-level policies operate in 3D metric space on point clouds, and feeding them 2D guidance that lacks depth forces each waypoint to be assigned the depth of whatever scene surface lies beneath it, producing geometrically distorted trajectories. We propose 3D HAMSTER, a hierarchical framework that closes this gap by having the planner directly output metrically reliable 3D trajectories. We augment a VLM with a dedicated depth encoder and a dense depth reconstruction objective to predict 3D waypoint sequences, which are directly integrated into a pointcloudbased low-level policy. Across 3D trajectory prediction, simulation, and real-world manipulation, 3D HAMSTER consistently outperforms proprietary VLMs and 2D-guided baselines, with the largest gains under appearance-altering shifts and unseen language, spatial, and visual conditions. The project page is available at https://davian-robotics.github.io/3D_HAMSTER/.