SynCity 3000: Autoarranque de difusión 3D a escala de escena
SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion
July 6, 2026
Autores: Paul Engstler, Iro Laina, Christian Rupprecht, Andrea Vedaldi
cs.AI
Resumen
Presentamos SynCity 3000, un marco para generar escenas 3D que son globalmente coherentes a la vez que permiten un control detallado del diseño. Basándonos en la capacidad de los generadores actuales de imagen a 3D para producir activos 3D complejos a partir de una sola imagen, extendemos esta capacidad a la escala de escenas completas adaptando el generador para que sea aplicable como operador convolucional. Esto se logra mediante el ajuste fino del modelo con datos similares a escenas generados por un nuevo motor de datos sintéticos, que proponemos para abordar la escasez de datos de escenas 3D para el entrenamiento. El generador convolucional se aplica luego a una imagen dimétrica de toda la escena, generada a partir de la indicación del usuario, obteniendo escenas 3D de tamaño y complejidad arbitrarios. A través de diversas indicaciones y diseños, SynCity 3000 produce escenas grandes, coherentes y detalladas, abordando las limitaciones de enfoques previos para la generación de escenas 3D.
English
We present SynCity 3000, a framework for generating 3D scenes that are globally coherent while enabling fine-grained layout control. Building on the ability of current image-to-3D generators to produce complex 3D assets from a single image, we extend this capability to the scale of entire scenes by adapting the generator to be applicable as a convolutional operator. We achieve this by fine-tuning the model on scene-like data generated by a new synthetic data engine, which we propose to address the scarcity of 3D scene data for training. The convolutional generator is then applied to a dimetric image of the entire scene, generated from the user prompt, resulting in 3D scenes of arbitrary size and complexity. Across diverse prompts and layouts, SynCity 3000 produces large, coherent, and detailed scenes, addressing the shortcomings of prior approaches to 3D scene generation.