ChatPaper.aiChatPaper

FLUX3D : Génération de Gaussiennes 3D de haute fidélité avec représentation parcimonieuse alignée par diffusion

FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation

June 23, 2026
Auteurs: Haorui Ji, Weizhe Liu, Hongdong Li, Hengkai Guo
cs.AI

Résumé

La représentation par voxels creux est devenue une base évolutive pour la génération d'Éclaboussures Gaussiennes 3D (3DGS) à partir d'images, mais les méthodes actuelles peinent à préserver les détails visuels haute fréquence des images d'entrée en raison de deux goulots d'étranglement structurels. Premièrement, elles adoptent des caractéristiques 2D discriminatives optimisées pour l'abstraction sémantique afin de construire des latents de voxels creux, ce qui supprime les indices reconstructifs et induit un goulot d'étranglement de représentation. Deuxièmement, lors de l'étape de génération, les transformateurs de diffusion standard manquent de mécanismes efficaces pour aligner les tokens d'images 2D denses avec les latents de voxels 3D creux, ce qui entraîne un goulot d'étranglement de correspondance inter-modale. Pour résoudre ces problèmes, nous proposons FLUX3D, un cadre évolutif d'image vers 3DGS qui améliore à la fois l'apprentissage de la représentation et l'alignement inter-modal lors de la génération. Nous revisitons d'abord la sélection des caractéristiques 2D pour l'apprentissage de représentations 3D à base de voxels creux, proposons les Latents Structurés Alignés par Diffusion (DA-SLAT) et les associons à une architecture à décodeur seul afin d'améliorer la fidélité de la reconstruction 3DGS. Nous concevons également un cadre de diffusion conscient de la structure creuse, qui intègre le Transformateur de Diffusion Multimodal à Structure Creuse (SMDiT) et le Positionnement Rotatif Conscient de la Modalité (MARoPE) pour réaliser un alignement 2D-3D agnostique à la géométrie. Des expériences de référence approfondies démontrent que FLUX3D apporte des améliorations substantielles de la fidélité d'apparence et surpasse significativement toutes les méthodes de pointe (SOTA) pour la génération d'actifs 3DGS de haute qualité.
English
Sparse voxel representation has emerged as a scalable foundation for image-to-3D Gaussian Splatting (3DGS) generation, yet current methods struggle to preserve high-frequency visual details of input images due to two structural bottlenecks. First, they adopt discriminative 2D features optimized for semantic abstraction to construct sparse voxel latents, which suppress reconstructive cues and induce a representation bottleneck. Second, in the generation stage, standard diffusion transformers lack effective mechanisms to align dense 2D image tokens with sparse 3D voxel latents, resulting in a cross-modal correspondence bottleneck. To address these issues, we propose FLUX3D, a scalable image-to-3DGS framework that boosts both representation learning and cross-modal alignment during generation. We first revisit 2D feature selection for sparse-voxel-based 3D representation learning, propose Diffusion-Aligned Structured Latents (DA-SLAT) and couple it with a decoder-only architecture to improve 3DGS reconstruction fidelity. We also design a sparse-structure-aware diffusion framework, which integrates the Sparse-structure Multimodal Diffusion Transformer (SMDiT) and Modal-Aware Rotary Positional Embedding (MARoPE) to achieve geometry-agnostic 2D-3D alignment. Extensive benchmark experiments demonstrate that FLUX3D yields substantial improvements in appearance fidelity and significantly outperforms all state-of-the-art (SOTA) methods in generating high-quality 3DGS assets.