VidSplat: Reconstrução com Esferas Gaussianas usando Priores de Difusão de Vídeo Guiados por Geometria
VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors
May 12, 2026
Autores: Jimin Tang, Wenyuan Zhang, Junsheng Zhou, Zian Huang, Kanle Shi, Shenkun Xu, Yu-Shen Liu, Zhizhong Han
cs.AI
Resumo
O Gaussian Splatting alcançou progresso notável na reconstrução de superfície multivista, porém apresenta degradação significativa quando apenas poucas vistas estão disponíveis. Embora esforços recentes amenizem esse problema ao melhorar a consistência multivista para produzir superfícies plausíveis, eles têm dificuldade em inferir regiões não vistas, ocluídas ou fracamente restritas além da cobertura da entrada. Para lidar com essa limitação, apresentamos o VidSplat, uma estrutura de reconstrução generativa sem treinamento que aproveita priores poderosos de difusão de vídeo para sintetizar iterativamente novas vistas que compensam a cobertura de entrada faltante e, assim, recuperar cenas 3D completas a partir de entradas esparsas. Especificamente, abordamos dois desafios-chave que permitem a integração eficaz de geração e reconstrução. Primeiro, para geração consistente em 3D, elaboramos uma estratégia de remoção de ruído sem treinamento, em estágios, que guia adaptativamente a direção da remoção de ruído em direção à geometria subjacente usando as imagens RGB e de máscara renderizadas. Segundo, para aprimorar a reconstrução, desenvolvemos um mecanismo iterativo que amostra trajetórias de câmera, explora regiões não observadas, sintetiza novas vistas e complementa o treinamento por meio de refinamento ponderado por confiança. O VidSplat apresenta desempenho robusto para entrada esparsa e até mesmo para uma única imagem. Experimentos extensivos em benchmarks amplamente utilizados demonstram nosso desempenho superior na reconstrução de cenas com poucas vistas.
English
Gaussian Splatting has achieved remarkable progress in multi-view surface reconstruction, yet it exhibits notable degradation when only few views are available. Although recent efforts alleviate this issue by enhancing multi-view consistency to produce plausible surfaces, they struggle to infer unseen, occluded, or weakly constrained regions beyond the input coverage. To address this limitation, we present VidSplat, a training-free generative reconstruction framework that leverages powerful video diffusion priors to iteratively synthesize novel views that compensate for missing input coverage, and thereby recover complete 3D scenes from sparse inputs. Specifically, we tackle two key challenges that enable the effective integration of generation and reconstruction. First, for 3D consistent generation, we elaborate a training-free, stage-wise denoising strategy that adaptively guides the denoising direction toward the underlying geometry using the rendered RGB and mask images. Second, to enhance the reconstruction, we develop an iterative mechanism that samples camera trajectories, explores unobserved regions, synthesizes novel views, and supplements training through confidence weighted refinement. VidSplat performs robustly to sparse input and even a single image. Extensive experiments on widely used benchmarks demonstrate our superior performance in sparse-view scene reconstruction.