A Eficácia Surpreendente dos Modelos de Difusão de Vídeo para a Reconstrução de Movimentos da Mão
The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction
June 29, 2026
Autores: Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan
cs.AI
Resumo
A reconstrução 4D de movimento das mãos a partir de vídeo egocêntrico é limitada por claras deficiências dos métodos existentes: pipelines baseadas em imagens dependem de um detector que falha sob oclusão pesada, enquanto métodos baseados em vídeo dependem de módulos temporais aprendidos apenas a partir de anotações escassas de pose de mãos, um sinal estreito insuficiente para modelar a dinâmica do movimento, o raciocínio de oclusão e a interação mão-objeto. Essas capacidades, no entanto, são exatamente o que os modelos generativos de vídeo devem adquirir implicitamente quando treinados para sintetizar vídeos coerentes em escala da internet. Motivados por isso, apresentamos o ViDiHand, que aproveita as representações de um modelo de difusão de vídeo pré-treinado para reconstruir a pose 4D de duas mãos. Nós o adaptamos por meio de um objetivo de renderização de sobreposição de mãos que especializa suas características para mãos, preservando seus priors mundiais. Um decodificador então recupera a pose em escala métrica a partir das características adaptadas. Toda a pipeline opera diretamente em quadros completos – sem detector, sem preenchedor e sem otimização em tempo de teste. No ARCTIC, HOT3D e HOI4D, o ViDiHand supera substancialmente os métodos anteriores, estabelecendo os modelos de difusão de vídeo como uma nova base poderosa para a reconstrução de movimento das mãos e uma rota promissora para a coleta escalável de dados in-the-wild para IA incorporada. Página do projeto: https://vidihand.github.io.
English
4D hand motion reconstruction from egocentric video is bottlenecked by clear limitations of existing methods: image-based pipelines depend on a detector that fails under heavy occlusion, while video-based methods rely on temporal modules learned only from scarce hand-pose annotations, a narrow signal insufficient to model motion dynamics, occlusion reasoning, and hand-object interaction. These capabilities, however, are exactly what video generative models must implicitly acquire when trained to synthesize coherent video at internet scale. Motivated by this, we present ViDiHand, which leverages the representations of a pretrained video diffusion model to reconstruct 4D two-hand pose. We adapt it via a hand-overlay rendering objective that specializes its features for hands while preserving its world priors. A decoder then recovers metric-scale pose from the adapted features. The whole pipeline operates directly on full frames--no detector, no infiller, and no test-time optimization. On ARCTIC, HOT3D, and HOI4D, ViDiHand substantially outperforms prior methods, establishing video diffusion models as a powerful new foundation for hand motion reconstruction and a promising route to scalable in-the-wild data collection for embodied AI. Project page: https://vidihand.github.io.