ChatPaper.aiChatPaper

MetaView: Síntese de Novas Vistas Monocular com Priores Geométricos Implícitos Sensíveis à Escala

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

July 13, 2026
Autores: Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin
cs.AI

Resumo

Os modelos atuais de geração visual são capazes de produzir conteúdo de alta qualidade, porém carecem de uma percepção coerente da estrutura espacial. Métodos existentes de síntese generativa de novas vistas geralmente introduzem priores geométricos explícitos, que impõem consistência espacial, mas restringem inerentemente a generalização em grandes mudanças de vista. Em contraste, métodos generativos interativos recentes favorecem a modelagem implícita da cena, oferecendo maior flexibilidade ao custo de um controle preciso da câmera e da consistência geométrica. Neste artigo, propomos o MetaView, uma estrutura de síntese de novas vistas monoculares baseada em difusão que possibilita a renderização sob grandes mudanças de vista a partir de uma única imagem. Nosso insight principal é combinar a modelagem implícita da geometria com pistas 3D explícitas mínimas, porém essenciais: incorporamos priores geométricos implícitos de uma rede de percepção geométrica feed-forward para regularizar a estrutura sem impor pipelines de reconstrução restritivos, ao mesmo tempo que utilizamos profundidade métrica para ancorar a geração a uma escala métrica. Esse projeto permite que o MetaView alcance tanto consistência geométrica quanto controlabilidade precisa. Experimentos extensivos demonstram que, sob desafiadoras mudanças de ponto de vista monoculares de grande escala, o MetaView supera significativamente os métodos existentes e exibe generalização superior. Nosso código está disponível publicamente em https://github.com/KlingAIResearch/MetaView.
English
Current visual generation models are capable of producing high-quality content, yet they lack a coherent perception of the spatial structure. Existing generative novel view synthesis methods typically introduce explicit geometry priors, which enforce spatial consistency but inherently restrict generalization in large view changes. In contrast, recent interactive generative methods favor implicit scene modeling, offering greater flexibility at the cost of precise camera control and geometry consistency. In this paper, we propose MetaView, a diffusion-based monocular novel view synthesis framework that enables rendering under large view changes from a single image. Our key insight is to combine implicit geometry modeling with minimal yet essential explicit 3D cues: we incorporate implicit geometry priors from a feed-forward geometry perception network to regularize structure without imposing restrictive reconstruction pipelines, while leveraging metric depth to anchor the generation to a metric scale. This design allows MetaView to achieve both geometry consistency and precise controllability. Extensive experiments demonstrate that, under challenging monocular large viewpoint changes, MetaView significantly outperforms existing methods and exhibits superior generalization. Our code is publicly available at https://github.com/KlingAIResearch/MetaView.