MetaView : Synthèse de nouvelles vues monoculaire avec des priors géométriques implicites conscients de l'échelle
MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
July 13, 2026
Auteurs: Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin
cs.AI
Résumé
Les modèles de génération visuelle actuels sont capables de produire un contenu de haute qualité, mais ils manquent d'une perception cohérente de la structure spatiale. Les méthodes existantes de synthèse générative de nouvelles vues introduisent généralement des a priori géométriques explicites, qui imposent une cohérence spatiale mais limitent intrinsèquement la généralisation lors de changements de vue importants. En revanche, les méthodes génératives interactives récentes privilégient une modélisation implicite de la scène, offrant une plus grande flexibilité au détriment d'un contrôle précis de la caméra et de la cohérence géométrique. Dans cet article, nous proposons MetaView, un cadre de synthèse monoculaire de nouvelles vues basé sur la diffusion, permettant un rendu sous des changements de vue importants à partir d'une seule image. Notre idée clé consiste à combiner une modélisation géométrique implicite avec des indices 3D explicites minimaux mais essentiels : nous incorporons des a priori géométriques implicites provenant d'un réseau de perception géométrique à propagation avant pour régulariser la structure sans imposer de pipelines de reconstruction restrictifs, tout en exploitant la profondeur métrique pour ancrer la génération à une échelle métrique. Cette conception permet à MetaView d'atteindre à la fois une cohérence géométrique et une contrôlabilité précise. Des expériences approfondies montrent que, dans des conditions difficiles de changements de vue monoculaires importants, MetaView surpasse nettement les méthodes existantes et présente une généralisation supérieure. Notre code est disponible publiquement à l'adresse https://github.com/KlingAIResearch/MetaView.
English
Current visual generation models are capable of producing high-quality content, yet they lack a coherent perception of the spatial structure. Existing generative novel view synthesis methods typically introduce explicit geometry priors, which enforce spatial consistency but inherently restrict generalization in large view changes. In contrast, recent interactive generative methods favor implicit scene modeling, offering greater flexibility at the cost of precise camera control and geometry consistency. In this paper, we propose MetaView, a diffusion-based monocular novel view synthesis framework that enables rendering under large view changes from a single image. Our key insight is to combine implicit geometry modeling with minimal yet essential explicit 3D cues: we incorporate implicit geometry priors from a feed-forward geometry perception network to regularize structure without imposing restrictive reconstruction pipelines, while leveraging metric depth to anchor the generation to a metric scale. This design allows MetaView to achieve both geometry consistency and precise controllability. Extensive experiments demonstrate that, under challenging monocular large viewpoint changes, MetaView significantly outperforms existing methods and exhibits superior generalization. Our code is publicly available at https://github.com/KlingAIResearch/MetaView.