ChatPaper.aiChatPaper

MetaView: Monokulare Synthese neuartiger Ansichten mit skalenbewussten impliziten Geometrie-Priors

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

July 13, 2026
Autoren: Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin
cs.AI

Zusammenfassung

Aktuelle visuelle Generierungsmodelle sind in der Lage, qualitativ hochwertige Inhalte zu erzeugen, entbehren jedoch einer kohärenten Wahrnehmung der räumlichen Struktur. Bestehende generative Methoden zur neuartigen Ansichtssynthese führen typischerweise explizite Geometrie-Priors ein, die räumliche Konsist erzwingen, aber die Generalisierbarkeit bei großen Blickwinkeländerungen grundlegend einschränken. Im Gegensatz dazu bevorzugen neuere interaktive generative Methoden eine implizite Szenenmodellierung, die mehr Flexibilität bietet, jedoch auf Kosten präziser Kamerakontrolle und Geometriekonsistenz. In dieser Arbeit stellen wir MetaView vor, ein diffusionsbasiertes Framework zur monokularen Neuansichtssynthese, das das Rendern unter großen Blickwinkeländerungen aus einem Einzelbild ermöglicht. Unser zentraler Ansatz besteht darin, implizite Geometriemodellierung mit minimalen, aber essenziellen expliziten 3D-Hinweisen zu kombinieren: Wir integrieren implizite Geometrie-Priors aus einem Feed-Forward-Geometriewahrnehmungsnetzwerk, um die Struktur zu regularisieren, ohne restriktive Rekonstruktionspipelines aufzuerlegen, und nutzen gleichzeitig metrische Tiefe, um die Generierung an eine metrische Skala zu binden. Dieses Design ermöglicht es MetaView, sowohl Geometriekonsistenz als auch präzise Kontrollierbarkeit zu erreichen. Umfangreiche Experimente zeigen, dass MetaView bei herausfordernden monokularen großen Blickwinkeländerungen bestehende Methoden deutlich übertrifft und eine überlegene Generalisierungsfähigkeit aufweist. Unser Code ist öffentlich verfügbar unter https://github.com/KlingAIResearch/MetaView.
English
Current visual generation models are capable of producing high-quality content, yet they lack a coherent perception of the spatial structure. Existing generative novel view synthesis methods typically introduce explicit geometry priors, which enforce spatial consistency but inherently restrict generalization in large view changes. In contrast, recent interactive generative methods favor implicit scene modeling, offering greater flexibility at the cost of precise camera control and geometry consistency. In this paper, we propose MetaView, a diffusion-based monocular novel view synthesis framework that enables rendering under large view changes from a single image. Our key insight is to combine implicit geometry modeling with minimal yet essential explicit 3D cues: we incorporate implicit geometry priors from a feed-forward geometry perception network to regularize structure without imposing restrictive reconstruction pipelines, while leveraging metric depth to anchor the generation to a metric scale. This design allows MetaView to achieve both geometry consistency and precise controllability. Extensive experiments demonstrate that, under challenging monocular large viewpoint changes, MetaView significantly outperforms existing methods and exhibits superior generalization. Our code is publicly available at https://github.com/KlingAIResearch/MetaView.