VidSplat: Gaussiaanse Splatting Reconstructie met Geometrie-Gestuurde Video Diffusie Priors
VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors
May 12, 2026
Auteurs: Jimin Tang, Wenyuan Zhang, Junsheng Zhou, Zian Huang, Kanle Shi, Shenkun Xu, Yu-Shen Liu, Zhizhong Han
cs.AI
Samenvatting
Gaussiaanse splatting heeft opmerkelijk succes geboekt in multi-view oppervlaktereconstructie, maar vertoont aanzienlijke degradatie wanneer slechts weinig aanzichten beschikbaar zijn. Hoewel recente inspanningen dit probleem verlichten door de multi-view consistentie te verbeteren om plausibele oppervlakken te genereren, slagen zij er niet in om ongeziene, occludeerde of zwak gecontroleerde gebieden buiten de invoerdekking te infereren. Om deze beperking aan te pakken presenteren wij VidSplat, een trainingsvrij generatief reconstructieframework dat gebruikmaakt van krachtige videodiffusie-priors om iteratief nieuwe aanzichten te synthetiseren die de ontbrekende invoerdekking compenseren, en zo volledige 3D-scènes te herstellen uit schaarse invoer. Specifiek pakken wij twee kernuitdagingen aan die een effectieve integratie van generatie en reconstructie mogelijk maken. Ten eerste, voor 3D-consistente generatie, ontwikkelen wij een trainingsvrije, gefaseerde ontruisingsstrategie die de ontruisingsrichting adaptief stuurt naar de onderliggende geometrie, gebruikmakend van de gerenderde RGB- en maskerafbeeldingen. Ten tweede, om de reconstructie te verbeteren, ontwikkelen wij een iteratief mechanisme dat cameratrajecten bemonstert, ongeobserveerde regio's verkent, nieuwe aanzichten synthetiseert en de training aanvult door middel van vertrouwensgewogen verfijning. VidSplat presteert robuust bij schaarse invoer en zelfs bij een enkel beeld. Uitgebreide experimenten op veelgebruikte benchmarks tonen onze superieure prestaties aan in schaars-aanzicht scènereconstructie.
English
Gaussian Splatting has achieved remarkable progress in multi-view surface reconstruction, yet it exhibits notable degradation when only few views are available. Although recent efforts alleviate this issue by enhancing multi-view consistency to produce plausible surfaces, they struggle to infer unseen, occluded, or weakly constrained regions beyond the input coverage. To address this limitation, we present VidSplat, a training-free generative reconstruction framework that leverages powerful video diffusion priors to iteratively synthesize novel views that compensate for missing input coverage, and thereby recover complete 3D scenes from sparse inputs. Specifically, we tackle two key challenges that enable the effective integration of generation and reconstruction. First, for 3D consistent generation, we elaborate a training-free, stage-wise denoising strategy that adaptively guides the denoising direction toward the underlying geometry using the rendered RGB and mask images. Second, to enhance the reconstruction, we develop an iterative mechanism that samples camera trajectories, explores unobserved regions, synthesizes novel views, and supplements training through confidence weighted refinement. VidSplat performs robustly to sparse input and even a single image. Extensive experiments on widely used benchmarks demonstrate our superior performance in sparse-view scene reconstruction.