CGGS: Splatting Gaussiano Geométrico Aumentado por Consistencia para la Generación de Escenas 3D Ego-céntricas
CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-centric 3D Scene Generation
July 4, 2026
Autores: Zhenyu Sun, Xiaohan Zhang, Qi Liu, Huan Wang
cs.AI
Resumen
Persisten desafíos en la generación de escenas 3D egocéntricas debido a la escasa superposición de vistas y la influencia dominante de las perspectivas individuales en la interpretación de la escena. Estos factores dificultan la creación de contenido visual coherente en cuanto a puntos de vista y alineado semánticamente, así como la construcción de estructuras geométricas precisas. En este artículo, proponemos CGGS, un marco de trabajo texto-a-3D cuyo objetivo es mejorar la conciencia del contenido 3D y abordar las distorsiones geométricas en la generación de escenas egocéntricas. En primer lugar, se propone el Generador Egocéntrico, que ajusta finamente un Modelo de Difusión Latente Multivista con una pérdida aumentada por consistencia para generar contenido 2D de alta fidelidad y consistente, alineado con las descripciones textuales. A continuación, el Decorador de Diseño utiliza el flujo óptico y la correspondencia de puntos para estimar la profundidad, produciendo así nubes de puntos densas como diseños aproximados a partir de los priors 2D egocéntricos. Sobre esta inicialización, se propone el Refinador Geométrico para mejorar la reconstrucción Gaussiana 3D mediante una Pérdida de Profundidad de Información Mutua (MID) basada en entropía, combinada con un esquema de optimización jerárquico para mejorar la calidad visual y la estructura geométrica. Experimentos exhaustivos demuestran que CGGS supera a métodos anteriores en la generación de escenas 3D coherentes y precisas guiadas por texto. Página del proyecto: https://cggs-26.github.io/cggs26/.
English
Challenges remain in ego-centric 3D scene generation due to limited view overlap and the dominant influence of individual perspectives on scene interpretation. These factors hinder the creation of viewpoint-consistent and semantically aligned visual content, as well as the construction of accurate geometric structures. In this paper, we propose CGGS, a text-to-3D framework aiming to enhance 3D-content-awareness and address geometric distortions in ego-centric scene generation. Firstly, the Ego-centric Generator is proposed by fine-tuning a Multi-View Latent Diffusion Model with consistency-augmented loss to generate consistent, high-fidelity 2D content aligned with textual descriptions. Then, Layout Decorator leverages optical flow and point-track correspondence to estimate depth, therefore producing dense point clouds as coarse layouts from the ego-centric 2D priors. Building on this initialization, Geometric Refiner is proposed to enhance 3D Gaussian reconstruction via an entropy-based Mutual Information Depth Loss (MID) combined with a hierarchical optimization scheme for improving visual quality and geometric structure. Comprehensive experiments demonstrate that softred{CGGS} outperforms previous methods in generating coherent and accurate text-driven 3D scenes. Project page: https://cggs-26.github.io/cggs26/.