ChatPaper.aiChatPaper

3D HAMSTER: Unindo Planejamento e Controle em Modelos Hierárquicos de Visão-Linguagem-Ação através de Orientação de Trajetória 3D

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

June 30, 2026
Autores: Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo
cs.AI

Resumo

Modelos Hierárquicos Visão-Linguagem-Ação (VLA) separam o planejamento de alto nível do controle de baixo nível para melhorar a generalização em manipulação robótica. Trabalhos recentes nesse paradigma utilizam trajetórias do efetuador final em 2D, previstas por um Modelo de Visão-Linguagem (VLM), como orientação explícita para uma política downstream. No entanto, políticas de baixo nível estado-da-arte operam em espaço métrico 3D sobre nuvens de pontos, e alimentá-las com orientação 2D que carece de profundidade força cada waypoint a receber a profundidade da superfície da cena subjacente, produzindo trajetórias geometricamente distorcidas. Propomos o 3D HAMSTER, uma estrutura hierárquica que supre essa lacuna ao fazer o planejador produzir diretamente trajetórias 3D metricamente confiáveis. Aumentamos um VLM com um codificador de profundidade dedicado e um objetivo denso de reconstrução de profundidade para prever sequências de waypoints 3D, que são integradas diretamente em uma política de baixo nível baseada em nuvens de pontos. Em previsão de trajetórias 3D, simulação e manipulação no mundo real, o 3D HAMSTER supera consistentemente VLMs proprietários e baselines guiados por 2D, com os maiores ganhos sob deslocamentos que alteram a aparência e condições de linguagem, espaciais e visuais não vistas. A página do projeto está disponível em https://davian-robotics.github.io/3D_HAMSTER/.
English
Hierarchical Vision-Language-Action (VLA) models decouple high-level planning from low-level control to improve generalization in robot manipulation. Recent work in this paradigm uses 2D end-effector trajectories predicted by a Vision-Language Model (VLM) as explicit guidance for a downstream policy. However, state-of-the-art low-level policies operate in 3D metric space on point clouds, and feeding them 2D guidance that lacks depth forces each waypoint to be assigned the depth of whatever scene surface lies beneath it, producing geometrically distorted trajectories. We propose 3D HAMSTER, a hierarchical framework that closes this gap by having the planner directly output metrically reliable 3D trajectories. We augment a VLM with a dedicated depth encoder and a dense depth reconstruction objective to predict 3D waypoint sequences, which are directly integrated into a pointcloudbased low-level policy. Across 3D trajectory prediction, simulation, and real-world manipulation, 3D HAMSTER consistently outperforms proprietary VLMs and 2D-guided baselines, with the largest gains under appearance-altering shifts and unseen language, spatial, and visual conditions. The project page is available at https://davian-robotics.github.io/3D_HAMSTER/.