FLUX3D: Geração de Gaussianas 3D de Alta Fidelidade com Representação Esparsa Alinhada por Difusão
FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation
June 23, 2026
Autores: Haorui Ji, Weizhe Liu, Hongdong Li, Hengkai Guo
cs.AI
Resumo
A representação por voxels esparsos surgiu como uma base escalável para a geração de imagem para Gaussian Splatting 3D (3DGS), no entanto, os métodos atuais têm dificuldade em preservar detalhes visuais de alta frequência das imagens de entrada devido a dois gargalos estruturais. Primeiro, eles adotam características 2D discriminativas otimizadas para abstração semântica para construir latentes de voxels esparsos, o que suprime pistas reconstrutivas e induz um gargalo de representação. Segundo, no estágio de geração, os transformadores de difusão padrão carecem de mecanismos eficazes para alinhar tokens densos de imagem 2D com latentes esparsos de voxels 3D, resultando em um gargalo de correspondência cross-modal. Para abordar esses problemas, propomos o FLUX3D, uma estrutura escalável de imagem para 3DGS que impulsiona tanto a aprendizagem de representação quanto o alinhamento cross-modal durante a geração. Primeiro, revisamos a seleção de características 2D para aprendizagem de representação 3D baseada em voxels esparsos, propomos os Latentes Estruturados Alinhados por Difusão (DA-SLAT) e os acoplamos a uma arquitetura somente com decodificador para melhorar a fidelidade de reconstrução do 3DGS. Também projetamos uma estrutura de difusão consciente de estrutura esparsa, que integra o Transformador de Difusão Multimodal de Estrutura Esparsa (SMDiT) e a Incorporação Posicional Rotativa Ciente de Modalidade (MARoPE) para alcançar um alinhamento 2D-3D independente de geometria. Extensos experimentos de referência demonstram que o FLUX3D produz melhorias substanciais na fidelidade de aparência e supera significativamente todos os métodos de estado da arte (SOTA) na geração de ativos 3DGS de alta qualidade.
English
Sparse voxel representation has emerged as a scalable foundation for image-to-3D Gaussian Splatting (3DGS) generation, yet current methods struggle to preserve high-frequency visual details of input images due to two structural bottlenecks. First, they adopt discriminative 2D features optimized for semantic abstraction to construct sparse voxel latents, which suppress reconstructive cues and induce a representation bottleneck. Second, in the generation stage, standard diffusion transformers lack effective mechanisms to align dense 2D image tokens with sparse 3D voxel latents, resulting in a cross-modal correspondence bottleneck. To address these issues, we propose FLUX3D, a scalable image-to-3DGS framework that boosts both representation learning and cross-modal alignment during generation. We first revisit 2D feature selection for sparse-voxel-based 3D representation learning, propose Diffusion-Aligned Structured Latents (DA-SLAT) and couple it with a decoder-only architecture to improve 3DGS reconstruction fidelity. We also design a sparse-structure-aware diffusion framework, which integrates the Sparse-structure Multimodal Diffusion Transformer (SMDiT) and Modal-Aware Rotary Positional Embedding (MARoPE) to achieve geometry-agnostic 2D-3D alignment. Extensive benchmark experiments demonstrate that FLUX3D yields substantial improvements in appearance fidelity and significantly outperforms all state-of-the-art (SOTA) methods in generating high-quality 3DGS assets.