4D-реконструкция человека и сцены по данным с низким перекрытием

4D Human-Scene Reconstruction from Low-Overlap Captures

July 10, 2026
Авторы: Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park
cs.AI

Аннотация

Существующий объемный захват динамических движений человека достигает высокой точности при использовании плотных массивов камер. Однако в реальных сценариях доступно лишь несколько камер с малым перекрытием, что снижает качество выходных данных и оставляет большие области невидимыми. Современные методы 4D-реконструкции были сосредоточены на условиях малого перекрытия, однако они всё ещё создают заметные артефакты в плохо наблюдаемых областях. Модели диффузии видео появились как ещё один вариант, но они демонстрируют геометрически несогласованные результаты для людей. Для преодоления этих ограничений мы предлагаем StudioRecon — конвейер, который реконструирует 4D-сцены с людьми из разреженных камер с малым перекрытием путём разделения фона и людей. Мы уплотняем контроль фона, синтезируя сотни управляемых камерой новых ракурсов с помощью модели диффузии видео. Мы также надёжно инициализируем деформируемые гауссовы модели людей с помощью перекрёстной ассоциации идентичностей и триангулированной подгонки многовидовых ключевых точек. Наконец, наш рекурсивный модуль улучшения с внедрением адаптивной к движению согласованности гармонизирует составной результат, тем самым дополнительно избегая оставшихся артефактов. Мы достигаем передового синтеза новых ракурсов на четырёх реальных наборах данных и демонстрируем приложения, такие как визуализация новых траекторий и замена людей.
English
Existing volumetric capture of dynamic human performance achieves high fidelity with dense camera arrays. However, in real-world scenarios, only a handful of low-overlap cameras are available, which degrades the output quality and leaves large areas unobserved. Recent 4D reconstruction methods have focused on low-overlap settings, yet they still produce noticeable artifacts in under-observed regions. Video diffusion models have emerged as another option, but they show geometrically inconsistent results for humans. To address these limitations, we propose StudioRecon, a pipeline that reconstructs 4D human scenes from sparse, low-overlap cameras by decoupling background and humans. We densify background supervision by synthesizing hundreds of camera-controlled novel views with a video diffusion model. We also robustly initialize deformable Gaussian humans with cross-view identity association and triangulated multi-view keypoint fitting. Finally, our recursive enhancement module with motion-adaptive consistency injection harmonizes the composed output, thereby further avoiding remaining artifacts. We achieve state-of-the-art novel view synthesis across four real-world datasets and demonstrate applications such as novel trajectory rendering and human replacement.
PDF412July 15, 2026