ChatPaper.aiChatPaper

Pixal3D: Pixel-Uitgelijnde 3D-Generatie uit Beelden

Pixal3D: Pixel-Aligned 3D Generation from Images

May 11, 2026
Auteurs: Dong-Yang Li, Wang Zhao, Yuxin Chen, Wenbo Hu, Meng-Hao Guo, Fang-Lue Zhang, Ying Shan, Shi-Min Hu
cs.AI

Samenvatting

Recente vorderingen in 3D-generatieve modellen hebben de kwaliteit van beeld-naar-3D-synthese snel verbeterd, waardoor geometrie met een hogere resolutie en een realistischere verschijning mogelijk zijn. Toch blijft getrouwheid, die de pixelniveau-getrouwheid van het gegenereerde 3D-model aan het invoerbeeld meet, een centraal knelpunt. Wij stellen dat dit voortkomt uit een impliciet 2D-3D-correspondentieprobleem: de meeste 3D-native generatoren synthetiseren vorm in een canonieke ruimte en injecteren beeldinformatie via aandacht, waardoor pixel-naar-3D-associaties dubbelzinnig blijven. Om dit probleem aan te pakken, putten we inspiratie uit 3D-reconstructie en stellen we Pixal3D voor, een pixel-uitgelijnd 3D-generatieparadigma voor het creëren van 3D-modellen met hoge getrouwheid uit beelden. In plaats van te genereren in een canonieke houding, genereert Pixal3D direct 3D op een pixel-uitgelijnde manier, consistent met het invoeraanzicht. Om dit mogelijk te maken, introduceren we een pixel-terugprojectieconditioneringsschema dat meerschalige beeldkenmerken expliciet in een 3D-kenmerkenvolume tilt, waardoor directe pixel-naar-3D-correspondentie zonder dubbelzinnigheid wordt gevestigd. We tonen aan dat Pixal3D niet alleen schaalbaar is en in staat is om hoogwaardige 3D-modellen te produceren, maar ook de getrouwheid aanzienlijk verbetert, tot het niveau van reconstructie. Bovendien breidt Pixal3D zich natuurlijk uit naar multi-view generatie door teruggeprojecteerde kenmerkenvolumes over aanzichten te aggregeren. Ten slotte tonen we aan dat pixel-uitgelijnde generatie voordelig is voor scènesynthese, en presenteren we een modulaire pijplijn die object-gescheiden 3D-scènes met hoge getrouwheid uit beelden produceert. Pixal3D toont voor het eerst 3D-native pixel-uitgelijnde generatie op schaal aan en biedt een nieuwe inspirerende weg naar 3D-generatie met hoge getrouwheid van objecten of scènes uit enkel- of meervoudige aanzichten. Projectpagina: https://ldyang694.github.io/projects/pixal3d/
English
Recent advances in 3D generative models have rapidly improved image-to-3D synthesis quality, enabling higher-resolution geometry and more realistic appearance. Yet fidelity, which measures pixel-level faithfulness of the generated 3D asset to the input image, still remains a central bottleneck. We argue this stems from an implicit 2D-3D correspondence issue: most 3D-native generators synthesize shape in canonical space and inject image cues via attention, leaving pixel-to-3D associations ambiguous. To tackle this issue, we draw inspiration from 3D reconstruction and propose Pixal3D, a pixel-aligned 3D generation paradigm for high-fidelity 3D asset creation from images. Instead of generating in a canonical pose, Pixal3D directly generates 3D in a pixel-aligned way, consistent with the input view. To enable this, we introduce a pixel back-projection conditioning scheme that explicitly lifts multi-scale image features into a 3D feature volume, establishing direct pixel-to-3D correspondence without ambiguity. We show that Pixal3D is not only scalable and capable of producing high-quality 3D assets, but also substantially improves fidelity, approaching the fidelity level of reconstruction. Furthermore, Pixal3D naturally extends to multi-view generation by aggregating back-projected feature volumes across views. Finally, we show pixel-aligned generation benefits scene synthesis, and present a modular pipeline that produces high-fidelity, object-separated 3D scenes from images. Pixal3D for the first time demonstrates 3D-native pixel-aligned generation at scale, and provides a new inspiring way towards high-fidelity 3D generation of object or scene from single or multi-view images. Project page: https://ldyang694.github.io/projects/pixal3d/