ChatPaper.aiChatPaper

SynCity 3000: Bootstrapping da Difusão 3D em Escala de Cena

SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion

July 6, 2026
Autores: Paul Engstler, Iro Laina, Christian Rupprecht, Andrea Vedaldi
cs.AI

Resumo

Apresentamos o SynCity 3000, uma estrutura para geração de cenas 3D que são globalmente coerentes, ao mesmo tempo que permitem controle refinado de layout. Baseando-se na capacidade dos atuais geradores imagem-para-3D de produzir ativos 3D complexos a partir de uma única imagem, estendemos essa capacidade para a escala de cenas inteiras ao adaptar o gerador para ser aplicável como um operador convolucional. Alcançamos isso ajustando o modelo em dados semelhantes a cenas gerados por um novo motor de dados sintéticos, que propomos para lidar com a escassez de dados de cenas 3D para treinamento. O gerador convolucional é então aplicado a uma imagem dimétrica de toda a cena, gerada a partir do prompt do usuário, resultando em cenas 3D de tamanho e complexidade arbitrários. Em diversos prompts e layouts, o SynCity 3000 produz cenas grandes, coerentes e detalhadas, abordando as deficiências das abordagens anteriores para geração de cenas 3D.
English
We present SynCity 3000, a framework for generating 3D scenes that are globally coherent while enabling fine-grained layout control. Building on the ability of current image-to-3D generators to produce complex 3D assets from a single image, we extend this capability to the scale of entire scenes by adapting the generator to be applicable as a convolutional operator. We achieve this by fine-tuning the model on scene-like data generated by a new synthetic data engine, which we propose to address the scarcity of 3D scene data for training. The convolutional generator is then applied to a dimetric image of the entire scene, generated from the user prompt, resulting in 3D scenes of arbitrary size and complexity. Across diverse prompts and layouts, SynCity 3000 produces large, coherent, and detailed scenes, addressing the shortcomings of prior approaches to 3D scene generation.