CGGS : Gaussian Splatting géométrique à cohérence augmentée pour la génération de scènes 3D égocentriques
CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-centric 3D Scene Generation
July 4, 2026
Auteurs: Zhenyu Sun, Xiaohan Zhang, Qi Liu, Huan Wang
cs.AI
Résumé
Des défis persistent dans la génération de scènes 3D égocentriques en raison du faible chevauchement des vues et de l'influence prédominante des perspectives individuelles sur l'interprétation des scènes. Ces facteurs entravent la création de contenus visuels cohérents du point de vue et sémantiquement alignés, ainsi que la construction de structures géométriques précises. Dans cet article, nous proposons CGGS, un framework texte-à-3D visant à améliorer la conscience du contenu 3D et à corriger les distorsions géométriques dans la génération de scènes égocentriques. Premièrement, le Générateur Égocentrique est proposé en affinant un modèle de diffusion latente multi-vue avec une perte augmentée par cohérence, afin de générer un contenu 2D cohérent et de haute fidélité, aligné sur des descriptions textuelles. Ensuite, le Décorateur de Disposition exploite le flux optique et la correspondance de points pour estimer la profondeur, produisant ainsi des nuages de points denses comme esquisses grossières à partir des a priori 2D égocentriques. Sur la base de cette initialisation, le Raffineur Géométrique est proposé pour améliorer la reconstruction gaussienne 3D via une perte d'information mutuelle basée sur l'entropie (MID) combinée à un schéma d'optimisation hiérarchique, afin d'améliorer la qualité visuelle et la structure géométrique. Des expériences complètes démontrent que CGGS surpasse les méthodes antérieures dans la génération de scènes 3D cohérentes et précises pilotées par texte. Page du projet : https://cggs-26.github.io/cggs26/.
English
Challenges remain in ego-centric 3D scene generation due to limited view overlap and the dominant influence of individual perspectives on scene interpretation. These factors hinder the creation of viewpoint-consistent and semantically aligned visual content, as well as the construction of accurate geometric structures. In this paper, we propose CGGS, a text-to-3D framework aiming to enhance 3D-content-awareness and address geometric distortions in ego-centric scene generation. Firstly, the Ego-centric Generator is proposed by fine-tuning a Multi-View Latent Diffusion Model with consistency-augmented loss to generate consistent, high-fidelity 2D content aligned with textual descriptions. Then, Layout Decorator leverages optical flow and point-track correspondence to estimate depth, therefore producing dense point clouds as coarse layouts from the ego-centric 2D priors. Building on this initialization, Geometric Refiner is proposed to enhance 3D Gaussian reconstruction via an entropy-based Mutual Information Depth Loss (MID) combined with a hierarchical optimization scheme for improving visual quality and geometric structure. Comprehensive experiments demonstrate that softred{CGGS} outperforms previous methods in generating coherent and accurate text-driven 3D scenes. Project page: https://cggs-26.github.io/cggs26/.