FLAT: Feedforward Latent Triangle Splatting para Geração Geometricamente Precisa de Cenas
FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation
June 23, 2026
Autores: Orest Kupyn, Goutam Bhat, Philipp Henzler, Fabian Manhardt, Christian Rupprecht, Federico Tombari
cs.AI
Resumo
Gerar cenas 3D exploráveis a partir de uma única imagem requer fortes priors generativos e representações geométricas precisas, adequadas para uso posterior. Os modelos atuais de difusão de vídeo oferecem geração de alta qualidade e codificam implicitamente a estrutura geométrica multivista no espaço latente. No entanto, os decodificadores feedforward existentes de cenas latentes tipicamente produzem Gaussianas 3D volumétricas que carecem de uma superfície bem definida, limitando seu uso em simulação ou pipelines gráficos padrão. Isso motiva a decodificação de primitivos alinhados à superfície, que não são apenas renderizáveis, mas também mais próximos de ativos geométricos explícitos. Investigamos se latentes de difusão de vídeo comprimidos podem ser mapeados diretamente para primitivos de superfície explícitos em uma única passagem. Para esse fim, introduzimos o FLAT e, pela primeira vez, mostramos que splats de triângulos podem ser decodificados diretamente de latentes de difusão de vídeo. Comparado à decodificação de Gaussianas 3D, prever primitivos planos é notoriamente mais desafiador devido à alta sensibilidade às orientações dos primitivos, muitas vezes levando a um fluxo de gradiente pobre. O FLAT resolve isso com dois ingredientes-chave: uma parametrização de rotação centrada nos raios para regressão de triângulos e uma nova função de janela de produto que melhora o fluxo de gradiente durante a renderização diferenciável de triângulos. Em benchmarks padrão, o FLAT alcança uma precisão geométrica significativamente melhor, mantendo qualidade visual competitiva em comparação com as linhas de base feedforward de última geração. Mostramos ainda que uma etapa leve de refinamento em tempo de teste converte a sopa de triângulos prevista em uma representação totalmente opaca e pronta para mecanismos de jogos, suportando renderização em tempo real. Ao avaliar variantes de 3DGS, 2DGS e splatting de triângulos sob uma configuração de treinamento idêntica, fornecemos a primeira análise sistemática das trocas de representação na geração feedforward de cenas. A página do projeto está disponível em https://flat-splat.github.io.
English
Generating explorable 3D scenes from a single image requires strong generative priors and accurate geometric representations suitable for downstream use. Current video diffusion models offer high-quality generation and implicitly encode multi-view geometric structure in latent space. However, existing feedforward latent scene decoders typically output volumetric 3D Gaussians that lack a well-defined surface, limiting their use in simulation or standard graphics pipelines. This motivates decoding surface-aligned primitives that are not only renderable but also closer to explicit geometric assets. We ask whether compressed video diffusion latents can be mapped directly to explicit surface primitives in a single pass. To this end, we introduce FLAT and, for the first time, show that triangle splats can be decoded directly from video diffusion latents. Compared with decoding 3D Gaussians, predicting flat primitives is notoriously more challenging due to high sensitivity to primitive orientations, oftentimes leading to poor gradient flow. FLAT solves with two key ingredients: a ray-centered rotation parameterization for triangle regression and a novel product window function that improves gradient flow during differentiable triangle rendering. On standard benchmarks, FLAT achieves significantly better geometric accuracy while maintaining competitive visual quality compared to state-of-the-art feedforward baselines. We further show that a lightweight test-time refinement step converts the predicted triangle soup into a fully opaque, game-engine-ready representation that supports real-time rendering. By evaluating 3DGS, 2DGS, and triangle splatting variants under an identical training setup, we provide the first systematic analysis of representation tradeoffs in feedforward scene generation. The project page is available at https://flat-splat.github.io