PixWorld: Объединение генерации и реконструкции 3D-сцен в пиксельном пространстве
PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
July 6, 2026
Авторы: Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian
cs.AI
Аннотация
3D реконструкция и генерация обычно решаются с помощью раздельных парадигм: пиксельной регрессии для реконструкции и латентной диффузии для генерации. Недавние работы пытаются объединить их в латентном пространстве, но с заметными недостатками: целевая функция диффузии определяется на латентных признаках, а не на базовом 3D-представлении, и обе ветви страдают от потери информации, вызванной латентным кодированием, при этом требуя предварительно обученный вариационный автокодировщик (VAE) или автокодировщик представлений (RAE). В данной статье мы переформулируем эти две задачи в рамках единой парадигмы диффузии в пиксельном пространстве и представляем PixWorld — единую модель, которая совместно решает задачи 3D реконструкции и генерации. Осуществляя супервизию диффузии непосредственно на рендеренных изображениях, PixWorld устраняет указанные ограничения и согласовывает оптимизацию с точностью 3D-сцены. Помимо фотометрической и перцептивной супервизии, работающей на уровне 2D-изображений и лишенной 3D-геометрической осведомленности, мы дополнительно вводим потерю геометрического восприятия, которая выравнивает рендеренные виды с их истинными значениями в геометрически осмысленном пространстве признаков предварительно обученной 3D-фундаментальной модели, обеспечивая 3D-структурную супервизию. PixWorld последовательно превосходит предыдущие методы генерации в латентном пространстве и соответствует современным методам реконструкции, демонстрируя превосходство единого подхода на основе пиксельного пространства.
English
3D reconstruction and generation are commonly tackled by separate paradigms: pixel-based regression for reconstruction, and latent diffusion for generation. Recent works attempt to unify them in latent space, but with notable drawbacks: the diffusion objective is defined on latent features rather than the underlying 3D representation, and both branches suffer from information loss introduced by latent encoding, while requiring a pretrained Variational Autoencoder (VAE) or Representation Autoencoder (RAE). In this paper, we reformulate these two tasks under a unified pixel-space diffusion paradigm and introduce PixWorld, a single model that jointly addresses 3D reconstruction and generation. By supervising diffusion directly on rendered images, PixWorld removes the above limitations and aligns optimization with 3D scene fidelity. Beyond photometric and perceptual supervision that operates at the 2D image level and lacks 3D geometric awareness, we further introduce a geometry perception loss that aligns rendered views with their ground truth in the geometry-aware feature space of a pretrained 3D foundation model, providing 3D structural supervision. PixWorld consistently outperforms prior latent-space generation methods and matches state-of-the-art reconstruction methods, demonstrating the superiority of a unified pixel-space approach.