Estimativa de Contato Denso de Mão sem Treinamento com Grandes Modelos de Linguagem Multimodais
Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models
May 7, 2026
Autores: Daniel Sungho Jung, Kyoung Mu Lee
cs.AI
Resumo
A estimativa densa de contato manual requer tanto uma compreensão semântica de alto nível quanto um raciocínio geométrico detalhado sobre a interação humana para localizar com precisão as regiões de contato. Recentemente, modelos de linguagem grandes multimodais (MLLMs) demonstraram fortes capacidades na compreensão da semântica visual, possibilitadas por conhecimentos prévios de visão e linguagem aprendidos a partir de dados em grande escala. No entanto, o uso de MLLMs para estimativa densa de contato manual ainda é pouco explorado. Existem dois grandes desafios na aplicação de MLLMs à estimativa densa de contato manual. Primeiro, codificar explicitamente a geometria 3D da mão é difícil, uma vez que os MLLMs operam principalmente nas modalidades de visão e linguagem. Segundo, capturar o contato detalhado no nível dos vértices continua sendo desafiador, pois os MLLMs tendem a focar na semântica de alto nível em vez de no raciocínio geométrico detalhado. Para enfrentar esses desafios, propomos o ContactPrompt, uma abordagem livre de treinamento e zero-shot para estimativa densa de contato manual usando MLLMs. Para codificar eficazmente a geometria 3D da mão, introduzimos uma segmentação detalhada das partes da mão e uma representação de grade de vértices por partes que fornece informações geométricas estruturadas e localizadas. Para permitir uma previsão densa de contato precisa e eficiente, desenvolvemos um raciocínio de contato estruturado em múltiplos estágios com condicionamento por partes, que progressivamente une a semântica global e a geometria detalhada. Assim, nosso método aproveita eficazmente as capacidades de raciocínio dos MLLMs ao mesmo tempo que possibilita uma estimativa densa e precisa do contato manual. Surpreendentemente, a abordagem proposta supera métodos supervisionados anteriores treinados em grandes conjuntos de dados de contato denso, sem exigir qualquer treinamento. Os códigos serão disponibilizados.
English
Dense hand contact estimation requires both high-level semantic understanding and fine-grained geometric reasoning of human interaction to accurately localize contact regions. Recently, multi-modal large language models (MLLMs) have demonstrated strong capabilities in understanding visual semantics, enabled by vision-language priors learned from large-scale data. However, leveraging MLLMs for dense hand contact estimation remains underexplored. There are two major challenges in applying MLLMs to dense hand contact estimation. First, encoding explicit 3D hand geometry is difficult, as MLLMs primarily operate on vision and language modalities. Second, capturing fine-grained vertex-level contact remains challenging, as MLLMs tend to focus on high-level semantics rather than detailed geometric reasoning. To address these challenges, we propose ContactPrompt, a training-free and zero-shot approach for dense hand contact estimation using MLLMs. To effectively encode 3D hand geometry, we introduce a detailed hand-part segmentation and a part-wise vertex-grid representation that provides structured, localized geometric information. To enable accurate and efficient dense contact prediction, we develop a multi-stage structured contact reasoning with part conditioning, progressively bridging global semantics and fine-grained geometry. Therefore, our method effectively leverages the reasoning capabilities of MLLMs while enabling precise dense hand contact estimation. Surprisingly, the proposed approach outperforms previous supervised methods trained on large-scale dense contact datasets without requiring any training. The codes will be released.