4D Reconstructie van Mens en Scène uit Opnames met Lage Overlap
4D Human-Scene Reconstruction from Low-Overlap Captures
July 10, 2026
Auteurs: Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park
cs.AI
Samenvatting
Bestaande volumetrische vastlegging van dynamische menselijke bewegingen bereikt een hoge getrouwheid met dichte camera-arrays. In praktijkscenario’s zijn echter slechts een handvol camera’s met geringe overlapping beschikbaar, wat de uitvoerkwaliteit aantast en grote gebieden onwaargenomen laat. Recente 4D-reconstructiemethoden richten zich op instellingen met geringe overlapping, maar produceren nog steeds zichtbare artefacten in onvoldoende waargenomen gebieden. Videodiffusiemodellen zijn naar voren gekomen als een alternatief, maar laten geometrisch inconsistente resultaten zien voor mensen. Om deze beperkingen aan te pakken, stellen wij StudioRecon voor, een pijplijn die 4D-menselijke scènes reconstrueert uit schaarse camera’s met geringe overlapping door achtergrond en mensen te ontkoppelen. Wij verdichten het toezicht op de achtergrond door honderden cameragestuurde nieuwe aanzichten te synthetiseren met een videodiffusiemodel. Ook initialiseren wij robuust vervormbare Gaussiaanse mensen met kruiselingse identiteitsassociatie tussen aanzichten en getrianguleerde meervoudige-aanzichten-sleutelpuntfitting. Ten slotte harmoniseert onze recursieve verbeteringsmodule met bewegingsadaptieve consistentie-injectie de samengestelde uitvoer, waardoor resterende artefacten verder worden voorkomen. Wij behalen state-of-the-art synthese van nieuwe aanzichten in vier praktijkdatasets en demonstreren toepassingen zoals weergave van nieuwe trajecten en vervanging van mensen.
English
Existing volumetric capture of dynamic human performance achieves high fidelity with dense camera arrays. However, in real-world scenarios, only a handful of low-overlap cameras are available, which degrades the output quality and leaves large areas unobserved. Recent 4D reconstruction methods have focused on low-overlap settings, yet they still produce noticeable artifacts in under-observed regions. Video diffusion models have emerged as another option, but they show geometrically inconsistent results for humans. To address these limitations, we propose StudioRecon, a pipeline that reconstructs 4D human scenes from sparse, low-overlap cameras by decoupling background and humans. We densify background supervision by synthesizing hundreds of camera-controlled novel views with a video diffusion model. We also robustly initialize deformable Gaussian humans with cross-view identity association and triangulated multi-view keypoint fitting. Finally, our recursive enhancement module with motion-adaptive consistency injection harmonizes the composed output, thereby further avoiding remaining artifacts. We achieve state-of-the-art novel view synthesis across four real-world datasets and demonstrate applications such as novel trajectory rendering and human replacement.