ChatPaper.aiChatPaper

CGGS: Геометрический гауссов сплаттинг с улучшенной согласованностью для эгоцентрической генерации 3D сцен

CGGS: Consistency-Augmented Geometric Gaussian Splatting for Ego-centric 3D Scene Generation

July 4, 2026
Авторы: Zhenyu Sun, Xiaohan Zhang, Qi Liu, Huan Wang
cs.AI

Аннотация

Проблемы, связанные с генерацией 3D-сцен с эгоцентрической точки зрения, сохраняются из-за ограниченного перекрытия обзоров и доминирующего влияния индивидуальных перспектив на интерпретацию сцены. Эти факторы препятствуют созданию согласованного по точкам обзора и семантически выровненного визуального контента, а также построению точных геометрических структур. В данной работе мы предлагаем CGGS — фреймворк преобразования текста в 3D, нацеленный на повышение осведомлённости о 3D-содержании и устранение геометрических искажений при генерации эгоцентрических сцен. Во-первых, предлагается эгоцентрический генератор (Ego-centric Generator), который донастраивает модель многовидовой латентной диффузии (Multi-View Latent Diffusion Model) с использованием функции потерь с усилением согласованности для генерации согласованного и высококачественного 2D-контента, соответствующего текстовым описаниям. Затем декор компоновки (Layout Decorator) использует оптический поток и соответствие точек для оценки глубины, тем самым создавая плотные облака точек в качестве грубых макетов на основе эгоцентрических 2D-приоров. Опираясь на такую инициализацию, предлагается геометрический уточнитель (Geometric Refiner), который улучшает реконструкцию 3D-гауссианов с помощью энтропийной функции потерь взаимной информации глубины (MID) в сочетании с иерархической схемой оптимизации для повышения визуального качества и геометрической структуры. Всесторонние эксперименты демонстрируют, что CGGS превосходит предыдущие методы в генерации когерентных и точных 3D-сцен, управляемых текстом. Страница проекта: https://cggs-26.github.io/cggs26/.
English
Challenges remain in ego-centric 3D scene generation due to limited view overlap and the dominant influence of individual perspectives on scene interpretation. These factors hinder the creation of viewpoint-consistent and semantically aligned visual content, as well as the construction of accurate geometric structures. In this paper, we propose CGGS, a text-to-3D framework aiming to enhance 3D-content-awareness and address geometric distortions in ego-centric scene generation. Firstly, the Ego-centric Generator is proposed by fine-tuning a Multi-View Latent Diffusion Model with consistency-augmented loss to generate consistent, high-fidelity 2D content aligned with textual descriptions. Then, Layout Decorator leverages optical flow and point-track correspondence to estimate depth, therefore producing dense point clouds as coarse layouts from the ego-centric 2D priors. Building on this initialization, Geometric Refiner is proposed to enhance 3D Gaussian reconstruction via an entropy-based Mutual Information Depth Loss (MID) combined with a hierarchical optimization scheme for improving visual quality and geometric structure. Comprehensive experiments demonstrate that softred{CGGS} outperforms previous methods in generating coherent and accurate text-driven 3D scenes. Project page: https://cggs-26.github.io/cggs26/.