PixWorld: Unificación de la generación y reconstrucción de escenas 3D en el espacio de píxeles
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
July 6, 2026
Autores: Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian
cs.AI
Resumen
La reconstrucción y generación 3D se abordan comúnmente mediante paradigmas separados: regresión basada en píxeles para la reconstrucción, y difusión latente para la generación. Trabajos recientes intentan unificarlas en el espacio latente, pero con desventajas notables: el objetivo de difusión se define sobre características latentes en lugar de la representación 3D subyacente, y ambas ramas sufren pérdida de información introducida por la codificación latente, además de requerir un Autoencoder Variacional (VAE) o un Autoencoder de Representación (RAE) preentrenados. En este artículo, reformulamos estas dos tareas bajo un paradigma unificado de difusión en espacio de píxeles e introducimos PixWorld, un modelo único que aborda conjuntamente la reconstrucción y generación 3D. Al supervisar la difusión directamente sobre imágenes renderizadas, PixWorld elimina las limitaciones anteriores y alinea la optimización con la fidelidad de la escena 3D. Más allá de la supervisión fotométrica y perceptual que opera a nivel de imagen 2D y carece de conciencia geométrica 3D, introducimos además una pérdida de percepción geométrica que alinea las vistas renderizadas con su verdad fundamental en el espacio de características con conocimiento geométrico de un modelo base 3D preentrenado, proporcionando supervisión estructural 3D. PixWorld supera consistentemente a los métodos previos de generación en espacio latente y equipara los métodos de reconstrucción de vanguardia, demostrando la superioridad de un enfoque unificado en espacio de píxeles.
English
3D reconstruction and generation are commonly tackled by separate paradigms: pixel-based regression for reconstruction, and latent diffusion for generation. Recent works attempt to unify them in latent space, but with notable drawbacks: the diffusion objective is defined on latent features rather than the underlying 3D representation, and both branches suffer from information loss introduced by latent encoding, while requiring a pretrained Variational Autoencoder (VAE) or Representation Autoencoder (RAE). In this paper, we reformulate these two tasks under a unified pixel-space diffusion paradigm and introduce PixWorld, a single model that jointly addresses 3D reconstruction and generation. By supervising diffusion directly on rendered images, PixWorld removes the above limitations and aligns optimization with 3D scene fidelity. Beyond photometric and perceptual supervision that operates at the 2D image level and lacks 3D geometric awareness, we further introduce a geometry perception loss that aligns rendered views with their ground truth in the geometry-aware feature space of a pretrained 3D foundation model, providing 3D structural supervision. PixWorld consistently outperforms prior latent-space generation methods and matches state-of-the-art reconstruction methods, demonstrating the superiority of a unified pixel-space approach.