Reconstrucción 4D de Escenas Humanas a Partir de Capturas con Baja Superposición
4D Human-Scene Reconstruction from Low-Overlap Captures
July 10, 2026
Autores: Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park
cs.AI
Resumen
La captura volumétrica existente de actuaciones humanas dinámicas logra una alta fidelidad con conjuntos densos de cámaras. Sin embargo, en escenarios del mundo real, solo se dispone de un puñado de cámaras con baja superposición, lo que degrada la calidad de salida y deja grandes áreas sin observar. Los métodos recientes de reconstrucción 4D se han centrado en configuraciones de baja superposición, pero aún producen artefactos notables en regiones poco observadas. Los modelos de difusión de video han surgido como otra opción, aunque muestran resultados geométricamente inconsistentes para humanos. Para abordar estas limitaciones, proponemos StudioRecon, un pipeline que reconstruye escenas humanas 4D a partir de cámaras dispersas con baja superposición, separando el fondo y los humanos. Densificamos la supervisión del fondo sintetizando cientos de nuevas vistas controladas por cámara con un modelo de difusión de video. También inicializamos de manera robusta humanos Gaussianos deformables con asociación de identidades entre vistas y ajuste de puntos clave multivista triangulados. Finalmente, nuestro módulo de mejora recursiva con inyección de consistencia adaptativa al movimiento armoniza la salida compuesta, evitando así artefactos restantes. Alcanzamos síntesis de nuevas vistas de última generación en cuatro conjuntos de datos del mundo real y demostramos aplicaciones como renderizado de trayectorias novedosas y reemplazo de humanos.
English
Existing volumetric capture of dynamic human performance achieves high fidelity with dense camera arrays. However, in real-world scenarios, only a handful of low-overlap cameras are available, which degrades the output quality and leaves large areas unobserved. Recent 4D reconstruction methods have focused on low-overlap settings, yet they still produce noticeable artifacts in under-observed regions. Video diffusion models have emerged as another option, but they show geometrically inconsistent results for humans. To address these limitations, we propose StudioRecon, a pipeline that reconstructs 4D human scenes from sparse, low-overlap cameras by decoupling background and humans. We densify background supervision by synthesizing hundreds of camera-controlled novel views with a video diffusion model. We also robustly initialize deformable Gaussian humans with cross-view identity association and triangulated multi-view keypoint fitting. Finally, our recursive enhancement module with motion-adaptive consistency injection harmonizes the composed output, thereby further avoiding remaining artifacts. We achieve state-of-the-art novel view synthesis across four real-world datasets and demonstrate applications such as novel trajectory rendering and human replacement.