ChatPaper.aiChatPaper

3D HAMSTER: Объединение планирования и управления в иерархических моделях визуального языка и действий с помощью трехмерного траекторного управления

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

June 30, 2026
Авторы: Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo
cs.AI

Аннотация

Иерархические модели Vision-Language-Action (VLA) разделяют планирование высокого уровня и низкоуровневое управление для улучшения обобщения в роботизированных манипуляциях. Недавние работы в этой парадигме используют траектории конечного эффектора в 2D, предсказанные Vision-Language Model (VLM), в качестве явного руководства для последующей политики. Однако современные низкоуровневые политики работают в трехмерном метрическом пространстве по облакам точек, и подача им 2D-руководства, лишенного глубины, вынуждает присваивать каждой промежуточной точке глубину той поверхности сцены, которая находится под ней, что приводит к геометрически искаженным траекториям. Мы предлагаем 3D HAMSTER — иерархическую структуру, устраняющую этот разрыв: планировщик напрямую выводит метрически надежные 3D-траектории. Мы дополняем VLM специализированным кодировщиком глубины и задачей плотной реконструкции глубины для предсказания последовательностей трехмерных точек пути, которые непосредственно интегрируются в низкоуровневую политику на основе облаков точек. В задачах прогнозирования трехмерных траекторий, симуляции и реальных манипуляций 3D HAMSTER последовательно превосходит проприетарные VLM и базовые подходы с 2D-руководством, причем наибольшие улучшения достигаются при изменениях внешнего вида, а также в невидимых ранее языковых, пространственных и визуальных условиях. Страница проекта доступна по адресу: https://davian-robotics.github.io/3D_HAMSTER/.
English
Hierarchical Vision-Language-Action (VLA) models decouple high-level planning from low-level control to improve generalization in robot manipulation. Recent work in this paradigm uses 2D end-effector trajectories predicted by a Vision-Language Model (VLM) as explicit guidance for a downstream policy. However, state-of-the-art low-level policies operate in 3D metric space on point clouds, and feeding them 2D guidance that lacks depth forces each waypoint to be assigned the depth of whatever scene surface lies beneath it, producing geometrically distorted trajectories. We propose 3D HAMSTER, a hierarchical framework that closes this gap by having the planner directly output metrically reliable 3D trajectories. We augment a VLM with a dedicated depth encoder and a dense depth reconstruction objective to predict 3D waypoint sequences, which are directly integrated into a pointcloudbased low-level policy. Across 3D trajectory prediction, simulation, and real-world manipulation, 3D HAMSTER consistently outperforms proprietary VLMs and 2D-guided baselines, with the largest gains under appearance-altering shifts and unseen language, spatial, and visual conditions. The project page is available at https://davian-robotics.github.io/3D_HAMSTER/.