MetaView: Монокулярный синтез новых видов с масштабно-осведомленными неявными геометрическими априорными знаниями
MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
July 13, 2026
Авторы: Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin
cs.AI
Аннотация
Современные модели визуальной генерации способны создавать высококачественный контент, однако им не хватает связного восприятия пространственной структуры. Существующие методы генеративного синтеза новых видов обычно вводят явные геометрические априорные знания, которые обеспечивают пространственную согласованность, но по своей сути ограничивают обобщение при больших изменениях ракурса. Напротив, недавние интерактивные генеративные методы отдают предпочтение неявному моделированию сцены, предлагая большую гибкость за счет точного управления камерой и согласованности геометрии.
В данной работе мы предлагаем MetaView — основанную на диффузии структуру синтеза новых видов по монокулярному изображению, позволяющую выполнять рендеринг при больших изменениях ракурса по одному снимку. Наша ключевая идея заключается в сочетании неявного геометрического моделирования с минимальными, но необходимыми явными 3D-подсказками: мы используем неявные геометрические априорные знания из сети прямого восприятия геометрии для регуляризации структуры без наложения ограничивающих реконструкционных конвейеров, одновременно применяя метрическую глубину для привязки генерации к метрическому масштабу. Такая архитектура позволяет MetaView достичь как согласованности геометрии, так и точной управляемости. Обширные эксперименты показывают, что в условиях сложных монокулярных изменений ракурса MetaView значительно превосходит существующие методы и демонстрирует превосходное обобщение.
Наш код находится в открытом доступе по адресу https://github.com/KlingAIResearch/MetaView.
English
Current visual generation models are capable of producing high-quality content, yet they lack a coherent perception of the spatial structure. Existing generative novel view synthesis methods typically introduce explicit geometry priors, which enforce spatial consistency but inherently restrict generalization in large view changes. In contrast, recent interactive generative methods favor implicit scene modeling, offering greater flexibility at the cost of precise camera control and geometry consistency. In this paper, we propose MetaView, a diffusion-based monocular novel view synthesis framework that enables rendering under large view changes from a single image. Our key insight is to combine implicit geometry modeling with minimal yet essential explicit 3D cues: we incorporate implicit geometry priors from a feed-forward geometry perception network to regularize structure without imposing restrictive reconstruction pipelines, while leveraging metric depth to anchor the generation to a metric scale. This design allows MetaView to achieve both geometry consistency and precise controllability. Extensive experiments demonstrate that, under challenging monocular large viewpoint changes, MetaView significantly outperforms existing methods and exhibits superior generalization. Our code is publicly available at https://github.com/KlingAIResearch/MetaView.