EgoForce: Pose 3D da Mão no Espaço da Câmera Guiada pelo Antebraço a partir de uma Câmera Egocêntrica Monocular
EgoForce: Forearm-Guided Camera-Space 3D Hand Pose from a Monocular Egocentric Camera
May 12, 2026
Autores: Christen Millerdurai, Shaoxiang Wang, Yaxu Xie, Vladislav Golyanik, Didier Stricker, Alain Pagani
cs.AI
Resumo
Reconstruir a pose e a forma 3D absolutas das mãos a partir do ponto de vista do usuário usando uma única câmera montada na cabeça é crucial para a interação egocêntrica prática em RV/RA, telepresença e tarefas de manipulação centradas nas mãos, onde a detecção deve permanecer compacta e não intrusiva. Embora os métodos RGB monoculares tenham avançado, eles permanecem limitados pela ambiguidade de escala de profundidade e têm dificuldade em generalizar para as diversas configurações ópticas dos dispositivos montados na cabeça. Como resultado, os modelos geralmente exigem treinamento extensivo em conjuntos de dados específicos do dispositivo, que são caros e trabalhosos de adquirir. Este artigo aborda esses desafios introduzindo o EgoForce, uma estrutura de reconstrução de mão 3D monocular que recupera de forma robusta a pose e a posição 3D absoluta da mão a partir do ponto de vista do usuário (no espaço da câmera). O EgoForce opera em modelos de câmera olho de peixe, perspectiva e grande angular distorcida usando uma única rede unificada. Nossa abordagem combina uma representação diferenciável do antebraço que estabiliza a pose da mão, um transformador unificado braço-mão que prevê a geometria da mão e do antebraço a partir de uma única visão egocêntrica, mitigando a ambiguidade de escala de profundidade, e um solucionador de forma fechada no espaço do raio que permite a recuperação da pose 3D absoluta em diversos modelos de câmera montados na cabeça. Experimentos em três benchmarks egocêntricos mostram que o EgoForce atinge precisão 3D de ponta, reduzindo o MPJPE (Erro Médio de Posição das Articulações) no espaço da câmera em até 28% no conjunto de dados HOT3D em comparação com métodos anteriores e mantendo desempenho consistente entre as configurações de câmera. Para mais detalhes, visite a página do projeto em https://dfki-av.github.io/EgoForce.
English
Reconstructing the absolute 3D pose and shape of the hands from the user's viewpoint using a single head-mounted camera is crucial for practical egocentric interaction in AR/VR, telepresence, and hand-centric manipulation tasks, where sensing must remain compact and unobtrusive. While monocular RGB methods have made progress, they remain constrained by depth-scale ambiguity and struggle to generalize across the diverse optical configurations of head-mounted devices. As a result, models typically require extensive training on device-specific datasets, which are costly and laborious to acquire. This paper addresses these challenges by introducing EgoForce, a monocular 3D hand reconstruction framework that recovers robust, absolute 3D hand pose and its position from the user's (camera-space) viewpoint. EgoForce operates across fisheye, perspective, and distorted wide-FOV camera models using a single unified network. Our approach combines a differentiable forearm representation that stabilizes hand pose, a unified arm-hand transformer that predicts both hand and forearm geometry from a single egocentric view, mitigating depth-scale ambiguity, and a ray space closed-form solver that enables absolute 3D pose recovery across diverse head-mounted camera models. Experiments on three egocentric benchmarks show that EgoForce achieves state-of-the-art 3D accuracy, reducing camera-space MPJPE by up to 28% on the HOT3D dataset compared to prior methods and maintaining consistent performance across camera configurations. For more details, visit the project page at https://dfki-av.github.io/EgoForce.