MetaView: Monoculaire synthese van nieuwe aanzichten met schaal-bewuste impliciete geometrie priori's
MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
July 13, 2026
Auteurs: Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin
cs.AI
Samenvatting
Huidige visuele generatiemodellen zijn in staat om hoogwaardige inhoud te produceren, maar missen een coherente perceptie van de ruimtelijke structuur. Bestaande generatieve methoden voor nieuwe aanzichtsynthese introduceren doorgaans expliciete geometrische voorkennis, wat ruimtelijke consistentie afdwingt, maar inherent de generalisatie bij grote aanzichtsveranderingen beperkt. Daarentegen geven recente interactieve generatieve methoden de voorkeur aan impliciete scenemodellering, wat meer flexibiliteit biedt ten koste van nauwkeurige cameracontrole en geometrische consistentie. In dit artikel presenteren wij MetaView, een diffusie-gebaseerd monocular nieuw aanzichtsyntheseraamwerk dat rendering mogelijk maakt onder grote aanzichtsveranderingen vanuit één enkele afbeelding. Ons belangrijkste inzicht is om impliciete geometriemodellering te combineren met minimale maar essentiële expliciete 3D-aanwijzingen: we integreren impliciete geometrische voorkennis van een feed-forward geometriewaarnemingsnetwerk om structuur te reguleren zonder restrictieve reconstructiepijplijnen op te leggen, terwijl we metrische diepte gebruiken om de generatie te verankeren aan een metrische schaal. Dit ontwerp stelt MetaView in staat om zowel geometrische consistentie als nauwkeurige beheersbaarheid te bereiken. Uitgebreide experimenten tonen aan dat MetaView bij uitdagende monocular grote aanzichtsveranderingen aanzienlijk beter presteert dan bestaande methoden en superieure generalisatie vertoont. Onze code is openbaar beschikbaar op https://github.com/KlingAIResearch/MetaView.
English
Current visual generation models are capable of producing high-quality content, yet they lack a coherent perception of the spatial structure. Existing generative novel view synthesis methods typically introduce explicit geometry priors, which enforce spatial consistency but inherently restrict generalization in large view changes. In contrast, recent interactive generative methods favor implicit scene modeling, offering greater flexibility at the cost of precise camera control and geometry consistency. In this paper, we propose MetaView, a diffusion-based monocular novel view synthesis framework that enables rendering under large view changes from a single image. Our key insight is to combine implicit geometry modeling with minimal yet essential explicit 3D cues: we incorporate implicit geometry priors from a feed-forward geometry perception network to regularize structure without imposing restrictive reconstruction pipelines, while leveraging metric depth to anchor the generation to a metric scale. This design allows MetaView to achieve both geometry consistency and precise controllability. Extensive experiments demonstrate that, under challenging monocular large viewpoint changes, MetaView significantly outperforms existing methods and exhibits superior generalization. Our code is publicly available at https://github.com/KlingAIResearch/MetaView.