MoCam: Síntese Unificada de Novas Vistas via Dinâmicas Estruturadas de Remoção de Ruído
MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics
May 12, 2026
Autores: Haofeng Liu, Yang Zhou, Ziheng Wang, Zhengbo Xu, Zhan Peng, Jie Ma, Jun Liang, Shengfeng He, Jing Li
cs.AI
Resumo
A síntese generativa de novas vistas enfrenta um dilema fundamental: priores geométricos fornecem alinhamento espacial, mas tornam-se esparsos e imprecisos sob mudanças de visão, enquanto priores de aparência oferecem fidelidade visual, mas carecem de correspondência geométrica. Métodos existentes ou propagam erros geométricos ao longo da geração ou sofrem com conflitos de sinal ao fundir ambos estaticamente. Apresentamos o MoCam, que emprega dinâmicas estruturadas de remoção de ruído para orquestrar uma progressão coordenada da geometria para a aparência dentro do processo de difusão. O MoCam primeiro utiliza priores geométricos nas etapas iniciais para ancorar estruturas grosseiras e tolerar sua incompletude, depois alterna para priores de aparência nas etapas posteriores para corrigir ativamente erros geométricos e refinar detalhes. Esse projeto unifica naturalmente a síntese de vistas estáticas e dinâmicas ao desacoplar temporalmente o alinhamento geométrico e o refinamento de aparência dentro do processo de difusão. Experimentos demonstram que o MoCam supera significativamente métodos anteriores, particularmente quando nuvens de pontos contenham buracos ou distorções severas, alcançando uma desassociação robusta entre geometria e aparência.
English
Generative novel view synthesis faces a fundamental dilemma: geometric priors provide spatial alignment but become sparse and inaccurate under view changes, while appearance priors offer visual fidelity but lack geometric correspondence. Existing methods either propagate geometric errors throughout generation or suffer from signal conflicts when fusing both statically. We introduce MoCam, which employs structured denoising dynamics to orchestrate a coordinated progression from geometry to appearance within the diffusion process.MoCam first leverages geometric priors in early stages to anchor coarse structures and tolerate their incompleteness, then switches to appearance priors in later stages to actively correct geometric errors and refine details. This design naturally unifies static and dynamic view synthesis by temporally decoupling geometric alignment and appearance refinement within the diffusion process.Experiments demonstrate that MoCam significantly outperforms prior methods, particularly when point clouds contain severe holes or distortions, achieving robust geometry-appearance disentanglement.