ChatPaper.aiChatPaper

Estimation dense de contact de la main sans apprentissage avec des modèles de langage multimodaux de grande taille

Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models

May 7, 2026
Auteurs: Daniel Sungho Jung, Kyoung Mu Lee
cs.AI

Résumé

L'estimation dense du contact de la main nécessite à la fois une compréhension sémantique de haut niveau et un raisonnement géométrique fin de l'interaction humaine pour localiser précisément les zones de contact. Récemment, les modèles de langage multimodaux de grande taille (MLLMs) ont démontré de fortes capacités de compréhension sémantique visuelle, grâce à des connaissances visio-linguistiques acquises sur des données à grande échelle. Cependant, l'exploitation des MLLMs pour l'estimation dense du contact de la main reste peu explorée. L'application des MLLMs à cette tâche se heurte à deux défis majeurs. Premièrement, encoder une géométrie explicite de la main en 3D est difficile, car les MLLMs opèrent principalement sur des modalités visuelles et langagières. Deuxièmement, capturer un contact fin au niveau des sommets reste difficile, car les MLLMs ont tendance à se concentrer sur la sémantique de haut niveau plutôt que sur un raisonnement géométrique détaillé. Pour relever ces défis, nous proposons ContactPrompt, une approche sans entraînement et zero-shot pour l'estimation dense du contact de la main utilisant les MLLMs. Afin d'encoder efficacement la géométrie 3D de la main, nous introduisons une segmentation détaillée des parties de la main et une représentation par grille de sommets par partie, fournissant des informations géométriques structurées et localisées. Pour permettre une prédiction dense et précise du contact, nous développons un raisonnement structuré du contact en plusieurs étapes avec conditionnement par partie, comblant progressivement le fossé entre la sémantique globale et la géométrie fine. Ainsi, notre méthode exploite efficacement les capacités de raisonnement des MLLMs tout en permettant une estimation dense et précise du contact de la main. Étonnamment, l'approche proposée surpasse les méthodes supervisées antérieures entraînées sur de grands ensembles de données de contact dense, sans nécessiter aucun entraînement. Les codes seront publiés.
English
Dense hand contact estimation requires both high-level semantic understanding and fine-grained geometric reasoning of human interaction to accurately localize contact regions. Recently, multi-modal large language models (MLLMs) have demonstrated strong capabilities in understanding visual semantics, enabled by vision-language priors learned from large-scale data. However, leveraging MLLMs for dense hand contact estimation remains underexplored. There are two major challenges in applying MLLMs to dense hand contact estimation. First, encoding explicit 3D hand geometry is difficult, as MLLMs primarily operate on vision and language modalities. Second, capturing fine-grained vertex-level contact remains challenging, as MLLMs tend to focus on high-level semantics rather than detailed geometric reasoning. To address these challenges, we propose ContactPrompt, a training-free and zero-shot approach for dense hand contact estimation using MLLMs. To effectively encode 3D hand geometry, we introduce a detailed hand-part segmentation and a part-wise vertex-grid representation that provides structured, localized geometric information. To enable accurate and efficient dense contact prediction, we develop a multi-stage structured contact reasoning with part conditioning, progressively bridging global semantics and fine-grained geometry. Therefore, our method effectively leverages the reasoning capabilities of MLLMs while enabling precise dense hand contact estimation. Surprisingly, the proposed approach outperforms previous supervised methods trained on large-scale dense contact datasets without requiring any training. The codes will be released.