Trainingsvrije dichte handcontactschatting met multimodale grote taalmodellen
Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models
May 7, 2026
Auteurs: Daniel Sungho Jung, Kyoung Mu Lee
cs.AI
Samenvatting
Dichte handcontactschatting vereist zowel een semantisch begrip op hoog niveau als een fijnmazige geometrische redenering van menselijke interactie om contactregio's nauwkeurig te lokaliseren. Recentelijk hebben multimodale grote taalmodellen (MLLMs) sterke capaciteiten getoond in het begrijpen van visuele semantiek, mogelijk gemaakt door visie-taal-priors die zijn geleerd uit grootschalige data. Het benutten van MLLMs voor dichte handcontactschatting blijft echter onderbelicht. Er zijn twee grote uitdagingen bij het toepassen van MLLMs op dichte handcontactschatting. Ten eerste is het coderen van expliciete 3D-handgeometrie moeilijk, omdat MLLMs voornamelijk opereren op visie- en taalmodaliteiten. Ten tweede blijft het vastleggen van fijnmazig contact op vertex-niveau uitdagend, omdat MLLMs de neiging hebben zich te richten op semantiek op hoog niveau in plaats van gedetailleerde geometrische redenering. Om deze uitdagingen aan te pakken, stellen we ContactPrompt voor, een trainingsvrije en zero-shot benadering voor dichte handcontactschatting met behulp van MLLMs. Om 3D-handgeometrie effectief te coderen, introduceren we een gedetailleerde handdeelsegmentatie en een per-onderdeel vertex-grid-representatie die gestructureerde, gelokaliseerde geometrische informatie biedt. Om nauwkeurige en efficiënte dichte contactvoorspelling mogelijk te maken, ontwikkelen we een meerfasige gestructureerde contactredenering met onderdeelconditionering, die geleidelijk de brug slaat tussen globale semantiek en fijnmazige geometrie. Daarom benut onze methode effectief de redeneringscapaciteiten van MLLMs terwijl het nauwkeurige dichte handcontactschatting mogelijk maakt. Verrassend genoeg presteert de voorgestelde benadering beter dan eerdere begeleide methoden die zijn getraind op grootschalige dichte contactdatasets, zonder enige training te vereisen. De codes zullen worden vrijgegeven.
English
Dense hand contact estimation requires both high-level semantic understanding and fine-grained geometric reasoning of human interaction to accurately localize contact regions. Recently, multi-modal large language models (MLLMs) have demonstrated strong capabilities in understanding visual semantics, enabled by vision-language priors learned from large-scale data. However, leveraging MLLMs for dense hand contact estimation remains underexplored. There are two major challenges in applying MLLMs to dense hand contact estimation. First, encoding explicit 3D hand geometry is difficult, as MLLMs primarily operate on vision and language modalities. Second, capturing fine-grained vertex-level contact remains challenging, as MLLMs tend to focus on high-level semantics rather than detailed geometric reasoning. To address these challenges, we propose ContactPrompt, a training-free and zero-shot approach for dense hand contact estimation using MLLMs. To effectively encode 3D hand geometry, we introduce a detailed hand-part segmentation and a part-wise vertex-grid representation that provides structured, localized geometric information. To enable accurate and efficient dense contact prediction, we develop a multi-stage structured contact reasoning with part conditioning, progressively bridging global semantics and fine-grained geometry. Therefore, our method effectively leverages the reasoning capabilities of MLLMs while enabling precise dense hand contact estimation. Surprisingly, the proposed approach outperforms previous supervised methods trained on large-scale dense contact datasets without requiring any training. The codes will be released.