ChatPaper.aiChatPaper

CGGS: Splatting Gaussiano Geométrico Aumentado por Consistência para Geração de Cenas 3D Egocêntricas

CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-centric 3D Scene Generation

July 4, 2026
Autores: Zhenyu Sun, Xiaohan Zhang, Qi Liu, Huan Wang
cs.AI

Resumo

Ainda existem desafios na geração de cenas 3D egocêntrica devido à limitada sobreposição de vistas e à influência dominante das perspectivas individuais na interpretação da cena. Esses fatores dificultam a criação de conteúdo visual consistente com o ponto de vista e alinhado semanticamente, bem como a construção de estruturas geométricas precisas. Neste artigo, propomos o CGGS, um framework texto-para-3D que visa melhorar a consciência do conteúdo 3D e corrigir distorções geométricas na geração de cenas egocêntricas. Primeiramente, o Gerador Egocêntrico é proposto por meio do refinamento de um Modelo de Difusão Latente Multi-View com perda aumentada por consistência para gerar conteúdo 2D consistente e de alta fidelidade, alinhado com descrições textuais. Em seguida, o Decorador de Layout utiliza fluxo óptico e correspondência de rastreamento de pontos para estimar profundidade, produzindo assim nuvens de pontos densas como layouts aproximados a partir de priores 2D egocêntricos. Com base nessa inicialização, o Refinador Geométrico é proposto para aprimorar a reconstrução Gaussiana 3D por meio de uma Perda de Profundidade por Informação Mútua (MID) baseada em entropia, combinada com um esquema de otimização hierárquica para melhorar a qualidade visual e a estrutura geométrica. Experimentos abrangentes demonstram que o CGGS supera métodos anteriores na geração de cenas 3D coerentes e precisas orientadas por texto. Página do projeto: https://cggs-26.github.io/cggs26/.
English
Challenges remain in ego-centric 3D scene generation due to limited view overlap and the dominant influence of individual perspectives on scene interpretation. These factors hinder the creation of viewpoint-consistent and semantically aligned visual content, as well as the construction of accurate geometric structures. In this paper, we propose CGGS, a text-to-3D framework aiming to enhance 3D-content-awareness and address geometric distortions in ego-centric scene generation. Firstly, the Ego-centric Generator is proposed by fine-tuning a Multi-View Latent Diffusion Model with consistency-augmented loss to generate consistent, high-fidelity 2D content aligned with textual descriptions. Then, Layout Decorator leverages optical flow and point-track correspondence to estimate depth, therefore producing dense point clouds as coarse layouts from the ego-centric 2D priors. Building on this initialization, Geometric Refiner is proposed to enhance 3D Gaussian reconstruction via an entropy-based Mutual Information Depth Loss (MID) combined with a hierarchical optimization scheme for improving visual quality and geometric structure. Comprehensive experiments demonstrate that softred{CGGS} outperforms previous methods in generating coherent and accurate text-driven 3D scenes. Project page: https://cggs-26.github.io/cggs26/.