ChatPaper.aiChatPaper

MetaView: Síntesis de Nuevas Vistas Monoculares con Priors Geométricos Implícitos Conscientes de la Escala

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

July 13, 2026
Autores: Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin
cs.AI

Resumen

Los modelos actuales de generación visual son capaces de producir contenido de alta calidad, pero carecen de una percepción coherente de la estructura espacial. Los métodos existentes de síntesis generativa de nuevas vistas suelen introducir priors geométricos explícitos, que imponen consistencia espacial pero limitan inherentemente la generalización en grandes cambios de vista. Por el contrario, los métodos generativos interactivos recientes favorecen el modelado implícito de escenas, ofreciendo mayor flexibilidad a costa de un control preciso de la cámara y la consistencia geométrica. En este artículo, proponemos MetaView, un marco de síntesis de nuevas vistas monoculares basado en difusión que permite el renderizado bajo grandes cambios de vista a partir de una sola imagen. Nuestra idea clave es combinar el modelado geométrico implícito con señales 3D explícitas mínimas pero esenciales: incorporamos priors geométricos implícitos de una red de percepción geométrica feed-forward para regularizar la estructura sin imponer tuberías de reconstrucción restrictivas, mientras aprovechamos la profundidad métrica para anclar la generación a una escala métrica. Este diseño permite que MetaView logre tanto consistencia geométrica como controlabilidad precisa. Experimentos exhaustivos demuestran que, bajo desafiantes cambios de punto de vista monocular de gran escala, MetaView supera significativamente a los métodos existentes y exhibe una generalización superior. Nuestro código está disponible públicamente en https://github.com/KlingAIResearch/MetaView.
English
Current visual generation models are capable of producing high-quality content, yet they lack a coherent perception of the spatial structure. Existing generative novel view synthesis methods typically introduce explicit geometry priors, which enforce spatial consistency but inherently restrict generalization in large view changes. In contrast, recent interactive generative methods favor implicit scene modeling, offering greater flexibility at the cost of precise camera control and geometry consistency. In this paper, we propose MetaView, a diffusion-based monocular novel view synthesis framework that enables rendering under large view changes from a single image. Our key insight is to combine implicit geometry modeling with minimal yet essential explicit 3D cues: we incorporate implicit geometry priors from a feed-forward geometry perception network to regularize structure without imposing restrictive reconstruction pipelines, while leveraging metric depth to anchor the generation to a metric scale. This design allows MetaView to achieve both geometry consistency and precise controllability. Extensive experiments demonstrate that, under challenging monocular large viewpoint changes, MetaView significantly outperforms existing methods and exhibits superior generalization. Our code is publicly available at https://github.com/KlingAIResearch/MetaView.