ChatPaper.aiChatPaper

FLAT : Feedforward Latent Triangle Splatting pour la génération de scènes géométriquement précises

FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation

June 23, 2026
Auteurs: Orest Kupyn, Goutam Bhat, Philipp Henzler, Fabian Manhardt, Christian Rupprecht, Federico Tombari
cs.AI

Résumé

Générer des scènes 3D explorables à partir d'une seule image nécessite de forts a priori génératifs et des représentations géométriques précises adaptées à une utilisation en aval. Les modèles de diffusion vidéo actuels offrent une génération de haute qualité et encodent implicitement la structure géométrique multi-vue dans l'espace latent. Cependant, les décodeurs de scènes latents feedforward existants produisent généralement des Gaussiennes 3D volumétriques qui manquent d'une surface bien définie, limitant leur utilisation dans la simulation ou les pipelines graphiques standard. Cela motive le décodage de primitives alignées sur la surface qui sont non seulement rendables mais aussi plus proches d'actifs géométriques explicites. Nous nous demandons si les latents de diffusion vidéo compressés peuvent être mappés directement à des primitives de surface explicites en un seul passage. À cette fin, nous introduisons FLAT et, pour la première fois, montrons que des splats triangulaires peuvent être décodés directement à partir de latents de diffusion vidéo. Comparé au décodage de Gaussiennes 3D, la prédiction de primitives plates est notoirement plus difficile en raison de la grande sensibilité aux orientations des primitives, menant souvent à un mauvais flux de gradient. FLAT résout cela avec deux ingrédients clés : une paramétrisation de rotation centrée sur le rayon pour la régression de triangles et une nouvelle fonction de fenêtre produit qui améliore le flux de gradient lors du rendu de triangles différentiable. Sur des benchmarks standards, FLAT atteint une précision géométrique significativement meilleure tout en maintenant une qualité visuelle compétitive par rapport aux bases feedforward de pointe. Nous montrons en outre qu'une étape de raffinement légère au moment du test convertit la soupe de triangles prédite en une représentation totalement opaque, prête pour un moteur de jeu, supportant le rendu en temps réel. En évaluant les variantes 3DGS, 2DGS et de splatting triangulaire dans un cadre d'entraînement identique, nous fournissons la première analyse systématique des compromis de représentation dans la génération de scènes feedforward. La page du projet est disponible à l'adresse https://flat-splat.github.io
English
Generating explorable 3D scenes from a single image requires strong generative priors and accurate geometric representations suitable for downstream use. Current video diffusion models offer high-quality generation and implicitly encode multi-view geometric structure in latent space. However, existing feedforward latent scene decoders typically output volumetric 3D Gaussians that lack a well-defined surface, limiting their use in simulation or standard graphics pipelines. This motivates decoding surface-aligned primitives that are not only renderable but also closer to explicit geometric assets. We ask whether compressed video diffusion latents can be mapped directly to explicit surface primitives in a single pass. To this end, we introduce FLAT and, for the first time, show that triangle splats can be decoded directly from video diffusion latents. Compared with decoding 3D Gaussians, predicting flat primitives is notoriously more challenging due to high sensitivity to primitive orientations, oftentimes leading to poor gradient flow. FLAT solves with two key ingredients: a ray-centered rotation parameterization for triangle regression and a novel product window function that improves gradient flow during differentiable triangle rendering. On standard benchmarks, FLAT achieves significantly better geometric accuracy while maintaining competitive visual quality compared to state-of-the-art feedforward baselines. We further show that a lightweight test-time refinement step converts the predicted triangle soup into a fully opaque, game-engine-ready representation that supports real-time rendering. By evaluating 3DGS, 2DGS, and triangle splatting variants under an identical training setup, we provide the first systematic analysis of representation tradeoffs in feedforward scene generation. The project page is available at https://flat-splat.github.io