PixWorld : Unification de la génération et de la reconstruction de scènes 3D dans l'espace pixel
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
July 6, 2026
Auteurs: Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian
cs.AI
Résumé
La reconstruction et la génération 3D sont généralement abordées via des paradigmes distincts : la régression basée sur les pixels pour la reconstruction, et la diffusion latente pour la génération. Des travaux récents tentent de les unifier dans l'espace latent, mais avec des inconvénients notables : l'objectif de diffusion est défini sur des caractéristiques latentes plutôt que sur la représentation 3D sous-jacente, et les deux branches souffrent de pertes d'information introduites par l'encodage latent, tout en nécessitant un autoencodeur variationnel (VAE) ou un autoencodeur de représentation (RAE) pré-entraîné. Dans cet article, nous reformulons ces deux tâches sous un paradigme de diffusion unifié dans l'espace des pixels et introduisons PixWorld, un modèle unique qui traite conjointement la reconstruction et la génération 3D. En supervisant la diffusion directement sur des images rendues, PixWorld élimine les limitations précédentes et aligne l'optimisation sur la fidélité de la scène 3D. Au-delà de la supervision photométrique et perceptuelle qui opère au niveau de l'image 2D et manque de conscience géométrique 3D, nous introduisons en outre une perte de perception géométrique qui aligne les vues rendues avec leurs vérités terrain dans l'espace de caractéristiques conscient de la géométrie d'un modèle de base 3D pré-entraîné, fournissant ainsi une supervision structurelle 3D. PixWorld surpasse systématiquement les méthodes antérieures de génération dans l'espace latent et atteint les performances des méthodes de reconstruction de pointe, démontrant la supériorité d'une approche unifiée dans l'espace des pixels.
English
3D reconstruction and generation are commonly tackled by separate paradigms: pixel-based regression for reconstruction, and latent diffusion for generation. Recent works attempt to unify them in latent space, but with notable drawbacks: the diffusion objective is defined on latent features rather than the underlying 3D representation, and both branches suffer from information loss introduced by latent encoding, while requiring a pretrained Variational Autoencoder (VAE) or Representation Autoencoder (RAE). In this paper, we reformulate these two tasks under a unified pixel-space diffusion paradigm and introduce PixWorld, a single model that jointly addresses 3D reconstruction and generation. By supervising diffusion directly on rendered images, PixWorld removes the above limitations and aligns optimization with 3D scene fidelity. Beyond photometric and perceptual supervision that operates at the 2D image level and lacks 3D geometric awareness, we further introduce a geometry perception loss that aligns rendered views with their ground truth in the geometry-aware feature space of a pretrained 3D foundation model, providing 3D structural supervision. PixWorld consistently outperforms prior latent-space generation methods and matches state-of-the-art reconstruction methods, demonstrating the superiority of a unified pixel-space approach.