ChatPaper.aiChatPaper

PointDiT: Диффузия в пространстве пикселей для монокулярной оценки геометрии

PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

July 2, 2026
Авторы: Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer
cs.AI

Аннотация

Современные методы трехмерной реконструкции по одному изображению часто опираются на сложные гибридные архитектуры и функции потерь, либо сжимают геометрию в латентные пространства для использования предварительно обученных латентных диффузионных моделей. В данной работе мы показываем, что такие архитектурные издержки и запутанные формулировки потерь излишни. Мы представляем минималистичный диффузионный трансформер в пиксельном пространстве, построенный на простом ViT, который работает непосредственно с сырыми патчами трехмерной карты точек и обусловлен токенами изображений от предварительно обученного DINOv3. В отличие от существующих подходов латентной диффузии, мы обучаем наш диффузионный бэкбон полностью с нуля, устраняя необходимость в токенизаторах карт точек. Несмотря на свою простоту, наш подход превосходит сложные латентные диффузионные модели, оставаясь при этом значительно проще гибридных альтернатив. Примечательно, что он обеспечивает более четкую геометрическую структуру и более устойчив в сильно неоднозначных областях, таких как прозрачные объекты.
English
State-of-the-art single-image 3D reconstruction methods often rely on complex hybrid architectures and loss functions, or compress geometry into latent spaces in order to leverage pre-trained latent diffusion models. In this work, we show that such architectural overhead and intricate loss formulations are unnecessary. We introduce a minimalist pixel-space Diffusion Transformer, built on a plain ViT, that operates directly on raw 3D point map patches and is conditioned on image tokens from a pre-trained DINOv3. Unlike existing latent diffusion approaches, we train our diffusion backbone entirely from scratch, eliminating the need for point map tokenizers. Despite its simplicity, our approach surpasses complex latent-based diffusion models while remaining significantly simpler than hybrid alternatives. Notably, it produces sharper geometric structure and is more robust in highly ambiguous regions, such as transparent objects.