ChatPaper.aiChatPaper

De verrassende effectiviteit van videodiffusiemodellen voor handbewegingsreconstructie

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

June 29, 2026
Auteurs: Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan
cs.AI

Samenvatting

4D-handbewegingsreconstructie uit egocentrische video wordt belemmerd door duidelijke beperkingen van bestaande methoden: beeldgebaseerde pijplijnen zijn afhankelijk van een detector die faalt bij zware occlusie, terwijl videogebaseerde methoden vertrouwen op temporele modules die alleen zijn getraind op schaarse hand-pose annotaties, een smal signaal dat onvoldoende is om bewegingsdynamiek, occlusieredenering en hand-object interactie te modelleren. Deze vaardigheden zijn echter precies wat videogeneratieve modellen impliciet moeten verwerven wanneer ze worden getraind om coherente video op internetschaal te synthetiseren. Gemotiveerd door dit presenteren we ViDiHand, dat de representaties van een voorgetraind videodiffusiemodel benut om 4D tweehandige pose te reconstrueren. We passen het aan via een hand-overlay rendering doelstelling die de kenmerken specialiseert voor handen, terwijl de wereldpriors behouden blijven. Een decoder herstelt vervolgens een pose op metrische schaal uit de aangepaste kenmerken. De gehele pijplijn werkt direct op volledige frames – geen detector, geen invuller en geen optimalisatie tijdens het testen. Op ARCTIC, HOT3D en HOI4D presteert ViDiHand aanzienlijk beter dan eerdere methoden, waarmee videodiffusiemodellen worden gevestigd als een krachtig nieuw fundament voor handbewegingsreconstructie en een veelbelovende route naar schaalbare dataverzameling in het wild voor belichaamde AI. Projectpagina: https://vidihand.github.io.
English
4D hand motion reconstruction from egocentric video is bottlenecked by clear limitations of existing methods: image-based pipelines depend on a detector that fails under heavy occlusion, while video-based methods rely on temporal modules learned only from scarce hand-pose annotations, a narrow signal insufficient to model motion dynamics, occlusion reasoning, and hand-object interaction. These capabilities, however, are exactly what video generative models must implicitly acquire when trained to synthesize coherent video at internet scale. Motivated by this, we present ViDiHand, which leverages the representations of a pretrained video diffusion model to reconstruct 4D two-hand pose. We adapt it via a hand-overlay rendering objective that specializes its features for hands while preserving its world priors. A decoder then recovers metric-scale pose from the adapted features. The whole pipeline operates directly on full frames--no detector, no infiller, and no test-time optimization. On ARCTIC, HOT3D, and HOI4D, ViDiHand substantially outperforms prior methods, establishing video diffusion models as a powerful new foundation for hand motion reconstruction and a promising route to scalable in-the-wild data collection for embodied AI. Project page: https://vidihand.github.io.