4D-Rekonstruktion von Mensch und Szene aus Aufnahmen mit geringer Überlappung
4D Human-Scene Reconstruction from Low-Overlap Captures
July 10, 2026
Autoren: Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park
cs.AI
Zusammenfassung
Vorhandene volumetrische Erfassung dynamischer menschlicher Darbietungen erreicht eine hohe Wiedergabetreue mit dichten Kameraarrays. In realen Szenarien stehen jedoch nur wenige Kameras mit geringer Überlappung zur Verfügung, was die Ausgabequalität beeinträchtigt und große Bereiche unbeobachtet lässt. Neuere 4D-Rekonstruktionsmethoden haben sich auf Szenarien mit geringer Überlappung konzentriert, erzeugen jedoch immer noch sichtbare Artefakte in schlecht beobachteten Regionen. Video-Diffusionsmodelle haben sich als weitere Option herausgestellt, zeigen aber geometrisch inkonsistente Ergebnisse für Menschen. Um diese Einschränkungen zu überwinden, schlagen wir StudioRecon vor, eine Pipeline, die 4D-Menschenszenen aus wenigen Kameras mit geringer Überlappung durch Entkopplung von Hintergrund und Menschen rekonstruiert. Wir verdichten die Hintergrundüberwachung, indem wir hunderte kamerakontrollierte Neuansichten mit einem Video-Diffusionsmodell synthetisieren. Außerdem initialisieren wir deformierbare Gaußsche Menschen robust mit ansichtsübergreifender Identitätsassoziation und trianguliertem Multi-View-Keypoint-Fitting. Schließlich harmonisiert unser rekursives Verbesserungsmodul mit bewegungsadaptiver Konsistenzinjektion die zusammengesetzte Ausgabe und vermeidet so weitere verbleibende Artefakte. Wir erzielen eine dem Stand der Technik entsprechende Neuansichtssynthese über vier reale Datensätze und demonstrieren Anwendungen wie neuartiges Trajektorien-Rendering und Menschenersatz.
English
Existing volumetric capture of dynamic human performance achieves high fidelity with dense camera arrays. However, in real-world scenarios, only a handful of low-overlap cameras are available, which degrades the output quality and leaves large areas unobserved. Recent 4D reconstruction methods have focused on low-overlap settings, yet they still produce noticeable artifacts in under-observed regions. Video diffusion models have emerged as another option, but they show geometrically inconsistent results for humans. To address these limitations, we propose StudioRecon, a pipeline that reconstructs 4D human scenes from sparse, low-overlap cameras by decoupling background and humans. We densify background supervision by synthesizing hundreds of camera-controlled novel views with a video diffusion model. We also robustly initialize deformable Gaussian humans with cross-view identity association and triangulated multi-view keypoint fitting. Finally, our recursive enhancement module with motion-adaptive consistency injection harmonizes the composed output, thereby further avoiding remaining artifacts. We achieve state-of-the-art novel view synthesis across four real-world datasets and demonstrate applications such as novel trajectory rendering and human replacement.