CGGS: Consistentie-Geaugmenteerde Geometrische Gaussiaanse Splatting voor Ego-centrische 3D-Scènegeneratie
CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-centric 3D Scene Generation
July 4, 2026
Auteurs: Zhenyu Sun, Xiaohan Zhang, Qi Liu, Huan Wang
cs.AI
Samenvatting
Uitdagingen blijven bestaan bij egocentrische 3D-scènengeneratie door beperkte zichtoverlap en de dominante invloed van individuele perspectieven op scène-interpretatie. Deze factoren belemmeren het creëren van perspectiefconsistente en semantisch afgestemde visuele inhoud, evenals de constructie van nauwkeurige geometrische structuren. In dit artikel stellen we CGGS voor, een tekst-naar-3D-raamwerk dat gericht is op het verbeteren van 3D-inhoudsbewustzijn en het aanpakken van geometrische vervormingen in egocentrische scènengeneratie. Ten eerste wordt de Egocentrische Generator voorgesteld door een Multi-View Latent Diffusiemodel te finetunen met een consistentie-verbeterde verliesfunctie om consistente, hoogwaardige 2D-inhoud te genereren die is afgestemd op tekstuele beschrijvingen. Vervolgens maakt de Layout Decorator gebruik van optische stroom en puntspoorcorrespondentie om diepte te schatten, waardoor dichte puntenwolken als grove layout worden geproduceerd uit de egocentrische 2D-priors. Op basis van deze initialisatie wordt de Geometrische Verfijner voorgesteld om 3D Gauss-herconstructie te verbeteren via een entropie-gebaseerd Mutual Information Depth Loss (MID), gecombineerd met een hiërarchisch optimalisatieschema voor verbetering van visuele kwaliteit en geometrische structuur. Uitgebreide experimenten tonen aan dat CGGS beter presteert dan eerdere methoden in het genereren van coherente en nauwkeurige tekstgestuurde 3D-scènes. Projectpagina: https://cggs-26.github.io/cggs26/.
English
Challenges remain in ego-centric 3D scene generation due to limited view overlap and the dominant influence of individual perspectives on scene interpretation. These factors hinder the creation of viewpoint-consistent and semantically aligned visual content, as well as the construction of accurate geometric structures. In this paper, we propose CGGS, a text-to-3D framework aiming to enhance 3D-content-awareness and address geometric distortions in ego-centric scene generation. Firstly, the Ego-centric Generator is proposed by fine-tuning a Multi-View Latent Diffusion Model with consistency-augmented loss to generate consistent, high-fidelity 2D content aligned with textual descriptions. Then, Layout Decorator leverages optical flow and point-track correspondence to estimate depth, therefore producing dense point clouds as coarse layouts from the ego-centric 2D priors. Building on this initialization, Geometric Refiner is proposed to enhance 3D Gaussian reconstruction via an entropy-based Mutual Information Depth Loss (MID) combined with a hierarchical optimization scheme for improving visual quality and geometric structure. Comprehensive experiments demonstrate that softred{CGGS} outperforms previous methods in generating coherent and accurate text-driven 3D scenes. Project page: https://cggs-26.github.io/cggs26/.