ChatPaper.aiChatPaper

PointDiT: Difusão no Espaço de Pixels para Estimativa de Geometria Monocular

PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

July 2, 2026
Autores: Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer
cs.AI

Resumo

Métodos de última geração para reconstrução 3D a partir de uma única imagem frequentemente dependem de arquiteturas híbridas complexas e funções de perda, ou comprimem a geometria em espaços latentes para aproveitar modelos de difusão latente pré-treinados. Neste trabalho, mostramos que essa sobrecarga arquitetural e formulações de perda intricadas são desnecessárias. Apresentamos um Transformer de Difusão minimalista no espaço de pixels, construído sobre um ViT simples, que opera diretamente em patches brutos de mapas de pontos 3D e é condicionado por tokens de imagem provenientes de um DINOv3 pré-treinado. Ao contrário das abordagens de difusão latente existentes, treinamos nosso backbone de difusão inteiramente do zero, eliminando a necessidade de tokenizadores de mapas de pontos. Apesar de sua simplicidade, nossa abordagem supera modelos complexos de difusão baseados em espaço latente, mantendo-se significativamente mais simples que alternativas híbridas. Notavelmente, ela produz uma estrutura geométrica mais nítida e é mais robusta em regiões altamente ambíguas, como objetos transparentes.
English
State-of-the-art single-image 3D reconstruction methods often rely on complex hybrid architectures and loss functions, or compress geometry into latent spaces in order to leverage pre-trained latent diffusion models. In this work, we show that such architectural overhead and intricate loss formulations are unnecessary. We introduce a minimalist pixel-space Diffusion Transformer, built on a plain ViT, that operates directly on raw 3D point map patches and is conditioned on image tokens from a pre-trained DINOv3. Unlike existing latent diffusion approaches, we train our diffusion backbone entirely from scratch, eliminating the need for point map tokenizers. Despite its simplicity, our approach surpasses complex latent-based diffusion models while remaining significantly simpler than hybrid alternatives. Notably, it produces sharper geometric structure and is more robust in highly ambiguous regions, such as transparent objects.