ChatPaper.aiChatPaper

PointDiT: Difusión en el espacio de píxeles para la estimación de geometría monocular

PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

July 2, 2026
Autores: Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer
cs.AI

Resumen

Los métodos de última generación para la reconstrucción 3D a partir de una sola imagen suelen depender de complejas arquitecturas híbridas y funciones de pérdida, o comprimen la geometría en espacios latentes para aprovechar modelos de difusión latente preentrenados. En este trabajo, demostramos que dicha sobrecarga arquitectónica y las intrincadas formulaciones de pérdida son innecesarias. Presentamos un Transformer de Difusión minimalista en el espacio de píxeles, basado en un ViT simple, que opera directamente sobre parches de mapas de puntos 3D en bruto y está condicionado por tokens de imagen provenientes de un DINOv3 preentrenado. A diferencia de los enfoques de difusión latente existentes, entrenamos nuestro backbone de difusión completamente desde cero, eliminando la necesidad de tokenizadores de mapas de puntos. A pesar de su simplicidad, nuestro enfoque supera a complejos modelos de difusión basados en latentes, manteniéndose significativamente más simple que las alternativas híbridas. Destaca por producir una estructura geométrica más nítida y ser más robusto en regiones altamente ambiguas, como los objetos transparentes.
English
State-of-the-art single-image 3D reconstruction methods often rely on complex hybrid architectures and loss functions, or compress geometry into latent spaces in order to leverage pre-trained latent diffusion models. In this work, we show that such architectural overhead and intricate loss formulations are unnecessary. We introduce a minimalist pixel-space Diffusion Transformer, built on a plain ViT, that operates directly on raw 3D point map patches and is conditioned on image tokens from a pre-trained DINOv3. Unlike existing latent diffusion approaches, we train our diffusion backbone entirely from scratch, eliminating the need for point map tokenizers. Despite its simplicity, our approach surpasses complex latent-based diffusion models while remaining significantly simpler than hybrid alternatives. Notably, it produces sharper geometric structure and is more robust in highly ambiguous regions, such as transparent objects.