Reconstrução 4D Humano-Cena a partir de Capturas de Baixa Sobreposição
4D Human-Scene Reconstruction from Low-Overlap Captures
July 10, 2026
Autores: Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park
cs.AI
Resumo
A captura volumétrica existente de desempenho humano dinâmico alcança alta fidelidade com arranjos densos de câmeras. No entanto, em cenários do mundo real, apenas um punhado de câmeras com baixa sobreposição está disponível, o que degrada a qualidade da saída e deixa grandes áreas não observadas. Métodos recentes de reconstrução 4D têm se concentrado em configurações de baixa sobreposição, mas ainda produzem artefatos perceptíveis em regiões subobservadas. Modelos de difusão de vídeo surgiram como outra opção, mas apresentam resultados geometricamente inconsistentes para humanos. Para superar essas limitações, propomos o StudioRecon, um fluxo de trabalho que reconstrói cenas humanas 4D a partir de câmeras esparsas e com baixa sobreposição, separando o fundo e os humanos. Densificamos a supervisão do fundo sintetizando centenas de novas vistas controladas por câmera com um modelo de difusão de vídeo. Também inicializamos de forma robusta humanos gaussianos deformáveis com associação de identidade entre vistas e ajuste de pontos-chave triangulados multivista. Por fim, nosso módulo de aprimoramento recursivo com injeção de consistência adaptativa ao movimento harmoniza a saída composta, evitando assim artefatos remanescentes. Alcançamos síntese de novas vistas de ponta em quatro conjuntos de dados do mundo real e demonstramos aplicações como renderização de trajetórias inéditas e substituição de humanos.
English
Existing volumetric capture of dynamic human performance achieves high fidelity with dense camera arrays. However, in real-world scenarios, only a handful of low-overlap cameras are available, which degrades the output quality and leaves large areas unobserved. Recent 4D reconstruction methods have focused on low-overlap settings, yet they still produce noticeable artifacts in under-observed regions. Video diffusion models have emerged as another option, but they show geometrically inconsistent results for humans. To address these limitations, we propose StudioRecon, a pipeline that reconstructs 4D human scenes from sparse, low-overlap cameras by decoupling background and humans. We densify background supervision by synthesizing hundreds of camera-controlled novel views with a video diffusion model. We also robustly initialize deformable Gaussian humans with cross-view identity association and triangulated multi-view keypoint fitting. Finally, our recursive enhancement module with motion-adaptive consistency injection harmonizes the composed output, thereby further avoiding remaining artifacts. We achieve state-of-the-art novel view synthesis across four real-world datasets and demonstrate applications such as novel trajectory rendering and human replacement.