Pixal3D: Geração 3D Alinhada por Pixel a partir de Imagens
Pixal3D: Pixel-Aligned 3D Generation from Images
May 11, 2026
Autores: Dong-Yang Li, Wang Zhao, Yuxin Chen, Wenbo Hu, Meng-Hao Guo, Fang-Lue Zhang, Ying Shan, Shi-Min Hu
cs.AI
Resumo
Avanços recentes em modelos generativos 3D rapidamente melhoraram a qualidade da síntese de imagem para 3D, possibilitando geometria de maior resolução e aparência mais realista. No entanto, a fidelidade, que mede a precisão em nível de pixel do ativo 3D gerado em relação à imagem de entrada, ainda permanece um gargalo central. Argumentamos que isso decorre de um problema implícito de correspondência 2D-3D: a maioria dos geradores nativos 3D sintetiza forma no espaço canônico e injeta pistas de imagem via atenção, deixando as associações pixel-3D ambíguas. Para enfrentar esse problema, inspiramo-nos na reconstrução 3D e propomos Pixal3D, um paradigma de geração 3D alinhado por pixel para criação de ativos 3D de alta fidelidade a partir de imagens. Em vez de gerar em uma pose canônica, o Pixal3D gera diretamente em 3D de forma alinhada por pixel, consistente com a vista de entrada. Para viabilizar isso, introduzimos um esquema de condicionamento por retroprojeção de pixel que eleva explicitamente características de imagem em múltiplas escalas para um volume de características 3D, estabelecendo correspondência direta pixel-3D sem ambiguidade. Mostramos que o Pixal3D não é apenas escalável e capaz de produzir ativos 3D de alta qualidade, mas também melhora substancialmente a fidelidade, aproximando-se do nível de fidelidade da reconstrução. Além disso, o Pixal3D se estende naturalmente à geração multivista ao agregar volumes de características retroprojetados entre vistas. Por fim, demonstramos que a geração alinhada por pixel beneficia a síntese de cenas e apresentamos um pipeline modular que produz cenas 3D de alta fidelidade e com separação de objetos a partir de imagens. O Pixal3D demonstra pela primeira vez a geração alinhada por pixel nativa 3D em escala e fornece um novo caminho inspirador para a geração 3D de alta fidelidade de objetos ou cenas a partir de imagens únicas ou multivistas. Página do projeto: https://ldyang694.github.io/projects/pixal3d/
English
Recent advances in 3D generative models have rapidly improved image-to-3D synthesis quality, enabling higher-resolution geometry and more realistic appearance. Yet fidelity, which measures pixel-level faithfulness of the generated 3D asset to the input image, still remains a central bottleneck. We argue this stems from an implicit 2D-3D correspondence issue: most 3D-native generators synthesize shape in canonical space and inject image cues via attention, leaving pixel-to-3D associations ambiguous. To tackle this issue, we draw inspiration from 3D reconstruction and propose Pixal3D, a pixel-aligned 3D generation paradigm for high-fidelity 3D asset creation from images. Instead of generating in a canonical pose, Pixal3D directly generates 3D in a pixel-aligned way, consistent with the input view. To enable this, we introduce a pixel back-projection conditioning scheme that explicitly lifts multi-scale image features into a 3D feature volume, establishing direct pixel-to-3D correspondence without ambiguity. We show that Pixal3D is not only scalable and capable of producing high-quality 3D assets, but also substantially improves fidelity, approaching the fidelity level of reconstruction. Furthermore, Pixal3D naturally extends to multi-view generation by aggregating back-projected feature volumes across views. Finally, we show pixel-aligned generation benefits scene synthesis, and present a modular pipeline that produces high-fidelity, object-separated 3D scenes from images. Pixal3D for the first time demonstrates 3D-native pixel-aligned generation at scale, and provides a new inspiring way towards high-fidelity 3D generation of object or scene from single or multi-view images. Project page: https://ldyang694.github.io/projects/pixal3d/