PixWorld: Het verenigen van 3D-scènegeneratie en -reconstructie in pixelruimte
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
July 6, 2026
Auteurs: Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian
cs.AI
Samenvatting
3D-reconstructie en -generatie worden gewoonlijk aangepakt met afzonderlijke paradigma's: pixelgebaseerde regressie voor reconstructie, en latente diffusie voor generatie. Recente studies proberen ze te verenigen in de latente ruimte, maar met opmerkelijke nadelen: de diffusiedoelstelling is gedefinieerd op latente kenmerken in plaats van op de onderliggende 3D-representatie, en beide takken lijden onder informatieverlies dat wordt geïntroduceerd door latente codering, terwijl ze een voorgetrainde Variational Autoencoder (VAE) of Representatie Autoencoder (RAE) vereisen. In dit artikel herformuleren we deze twee taken onder een verenigd pixelruimte-diffusieparadigma en introduceren we PixWorld, een enkel model dat zowel 3D-reconstructie als -generatie gezamenlijk aanpakt. Door diffusie direct te superviseren op gerenderde afbeeldingen, verwijdert PixWorld de bovengenoemde beperkingen en stemt het de optimalisatie af op 3D-scènegetrouwheid. Naast fotometrische en perceptuele supervisie, die op het 2D-beeldniveau werkt en 3D-geometrisch besef mist, introduceren we verder een geometriewaarnemingsverlies dat gerenderde aanzichten afstemt op hun grondwaarheid in de geometriebewuste kenmerkruimte van een voorgetraind 3D-fundatiemodel, wat 3D-structurele supervisie biedt. PixWorld presteert consequent beter dan eerdere methoden voor generatie in de latente ruimte en evenaart de modernste reconstructiemethoden, wat de superioriteit van een verenigde pixelruimtebenadering aantoont.
English
3D reconstruction and generation are commonly tackled by separate paradigms: pixel-based regression for reconstruction, and latent diffusion for generation. Recent works attempt to unify them in latent space, but with notable drawbacks: the diffusion objective is defined on latent features rather than the underlying 3D representation, and both branches suffer from information loss introduced by latent encoding, while requiring a pretrained Variational Autoencoder (VAE) or Representation Autoencoder (RAE). In this paper, we reformulate these two tasks under a unified pixel-space diffusion paradigm and introduce PixWorld, a single model that jointly addresses 3D reconstruction and generation. By supervising diffusion directly on rendered images, PixWorld removes the above limitations and aligns optimization with 3D scene fidelity. Beyond photometric and perceptual supervision that operates at the 2D image level and lacks 3D geometric awareness, we further introduce a geometry perception loss that aligns rendered views with their ground truth in the geometry-aware feature space of a pretrained 3D foundation model, providing 3D structural supervision. PixWorld consistently outperforms prior latent-space generation methods and matches state-of-the-art reconstruction methods, demonstrating the superiority of a unified pixel-space approach.