PointDiT : Diffusion dans l'espace des pixels pour l'estimation de géométrie monoculaire
PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
July 2, 2026
Auteurs: Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer
cs.AI
Résumé
Les méthodes de reconstruction 3D à partir d’une seule image les plus avancées reposent souvent sur des architectures hybrides complexes et des fonctions de perte, ou compressent la géométrie dans des espaces latents afin d’exploiter des modèles de diffusion latents pré-entraînés. Dans ce travail, nous montrons que ces surcharges architecturales et ces formulations de perte complexes sont inutiles. Nous introduisons un transformateur de diffusion minimaliste dans l’espace des pixels, construit sur un ViT simple, qui opère directement sur des patchs de cartes de points 3D brutes et est conditionné par des tokens d’image provenant d’un DINOv3 pré-entraîné. Contrairement aux approches de diffusion latente existantes, nous entraînons notre backbone de diffusion entièrement à partir de zéro, éliminant ainsi le besoin de tokenizers de cartes de points. Malgré sa simplicité, notre approche surpasse les modèles de diffusion latents complexes tout en restant significativement plus simple que les alternatives hybrides. Notamment, elle produit des structures géométriques plus nettes et est plus robuste dans les zones très ambiguës, comme les objets transparents.
English
State-of-the-art single-image 3D reconstruction methods often rely on complex hybrid architectures and loss functions, or compress geometry into latent spaces in order to leverage pre-trained latent diffusion models. In this work, we show that such architectural overhead and intricate loss formulations are unnecessary. We introduce a minimalist pixel-space Diffusion Transformer, built on a plain ViT, that operates directly on raw 3D point map patches and is conditioned on image tokens from a pre-trained DINOv3. Unlike existing latent diffusion approaches, we train our diffusion backbone entirely from scratch, eliminating the need for point map tokenizers. Despite its simplicity, our approach surpasses complex latent-based diffusion models while remaining significantly simpler than hybrid alternatives. Notably, it produces sharper geometric structure and is more robust in highly ambiguous regions, such as transparent objects.