ChatPaper.aiChatPaper

PixWorld: Unificando Geração e Reconstrução de Cenas 3D no Espaço de Pixel

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

July 6, 2026
Autores: Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian
cs.AI

Resumo

A reconstrução e a geração 3D são comumente abordadas por paradigmas separados: regressão baseada em pixels para reconstrução e difusão latente para geração. Trabalhos recentes tentam unificá-los no espaço latente, mas com desvantagens notáveis: o objetivo da difusão é definido sobre características latentes, e não sobre a representação 3D subjacente, e ambos os ramos sofrem com a perda de informação introduzida pela codificação latente, além de exigirem um Autoencoder Variacional (VAE) ou Autoencoder de Representação (RAE) pré-treinado. Neste artigo, reformulamos essas duas tarefas sob um paradigma unificado de difusão no espaço de pixels e introduzimos o PixWorld, um modelo único que aborda conjuntamente a reconstrução e a geração 3D. Ao supervisionar a difusão diretamente sobre imagens renderizadas, o PixWorld remove as limitações acima e alinha a otimização com a fidelidade da cena 3D. Além da supervisão fotométrica e perceptual que opera no nível da imagem 2D e carece de consciência geométrica 3D, introduzimos ainda uma perda de percepção geométrica que alinha as vistas renderizadas com sua verdade fundamental no espaço de características com consciência geométrica de um modelo base 3D pré-treinado, fornecendo supervisão estrutural 3D. O PixWorld supera consistentemente os métodos anteriores de geração no espaço latente e equipara-se aos métodos de reconstrução de última geração, demonstrando a superioridade de uma abordagem unificada no espaço de pixels.
English
3D reconstruction and generation are commonly tackled by separate paradigms: pixel-based regression for reconstruction, and latent diffusion for generation. Recent works attempt to unify them in latent space, but with notable drawbacks: the diffusion objective is defined on latent features rather than the underlying 3D representation, and both branches suffer from information loss introduced by latent encoding, while requiring a pretrained Variational Autoencoder (VAE) or Representation Autoencoder (RAE). In this paper, we reformulate these two tasks under a unified pixel-space diffusion paradigm and introduce PixWorld, a single model that jointly addresses 3D reconstruction and generation. By supervising diffusion directly on rendered images, PixWorld removes the above limitations and aligns optimization with 3D scene fidelity. Beyond photometric and perceptual supervision that operates at the 2D image level and lacks 3D geometric awareness, we further introduce a geometry perception loss that aligns rendered views with their ground truth in the geometry-aware feature space of a pretrained 3D foundation model, providing 3D structural supervision. PixWorld consistently outperforms prior latent-space generation methods and matches state-of-the-art reconstruction methods, demonstrating the superiority of a unified pixel-space approach.