Reconstruction 4D de scènes humaines à partir de captures à faible recouvrement
4D Human-Scene Reconstruction from Low-Overlap Captures
July 10, 2026
Auteurs: Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park
cs.AI
Résumé
La capture volumétrique existante de performances humaines dynamiques atteint une haute fidélité avec des réseaux denses de caméras. Cependant, dans les scénarios réels, seules quelques caméras à faible recouvrement sont disponibles, ce qui dégrade la qualité de sortie et laisse de vastes zones non observées. Les méthodes récentes de reconstruction 4D se sont concentrées sur des configurations à faible recouvrement, mais elles produisent encore des artefacts notables dans les zones sous-observées. Les modèles de diffusion vidéo sont apparus comme une autre option, mais ils montrent des résultats géométriquement incohérents pour les humains. Pour remédier à ces limitations, nous proposons StudioRecon, un pipeline qui reconstruit des scènes humaines 4D à partir de caméras éparses et à faible recouvrement en découplant l'arrière-plan et les humains. Nous densifions la supervision de l'arrière-plan en synthétisant des centaines de nouvelles vues contrôlées par caméra avec un modèle de diffusion vidéo. Nous initialisons également de manière robuste des humains gaussiens déformables avec une association d'identité inter-vues et un ajustement des points clés multi-vues triangulé. Enfin, notre module d'amélioration récursive avec injection de cohérence adaptative au mouvement harmonise la sortie composée, évitant ainsi davantage les artefacts restants. Nous obtenons une synthèse de nouvelles vues de pointe sur quatre ensembles de données réels et démontrons des applications telles que le rendu de trajectoires nouvelles et le remplacement d'humains.
English
Existing volumetric capture of dynamic human performance achieves high fidelity with dense camera arrays. However, in real-world scenarios, only a handful of low-overlap cameras are available, which degrades the output quality and leaves large areas unobserved. Recent 4D reconstruction methods have focused on low-overlap settings, yet they still produce noticeable artifacts in under-observed regions. Video diffusion models have emerged as another option, but they show geometrically inconsistent results for humans. To address these limitations, we propose StudioRecon, a pipeline that reconstructs 4D human scenes from sparse, low-overlap cameras by decoupling background and humans. We densify background supervision by synthesizing hundreds of camera-controlled novel views with a video diffusion model. We also robustly initialize deformable Gaussian humans with cross-view identity association and triangulated multi-view keypoint fitting. Finally, our recursive enhancement module with motion-adaptive consistency injection harmonizes the composed output, thereby further avoiding remaining artifacts. We achieve state-of-the-art novel view synthesis across four real-world datasets and demonstrate applications such as novel trajectory rendering and human replacement.