ChatPaper.aiChatPaper

SynCity 3000: bootstrappen van scène-schaal 3D-diffusie

SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion

July 6, 2026
Auteurs: Paul Engstler, Iro Laina, Christian Rupprecht, Andrea Vedaldi
cs.AI

Samenvatting

Wij presenteren SynCity 3000, een raamwerk voor het genereren van 3D-scènes die globaal coherent zijn en tegelijkertijd fijnmazige controle over de lay-out mogelijk maken. Voortbouwend op het vermogen van huidige beeld-naar-3D-generatoren om complexe 3D-assets te produceren op basis van één enkele afbeelding, breiden we deze mogelijkheid uit naar de schaal van volledige scènes door de generator aan te passen zodat deze als een convolutionele operator kan worden toegepast. Dit bereiken we door het model te fine-tunen op scène-achtige data gegenereerd door een nieuwe synthetische data-engine, die we voorstellen om het gebrek aan 3D-scènedata voor training aan te pakken. De convolutionele generator wordt vervolgens toegepast op een dimetrische afbeelding van de volledige scène, gegenereerd op basis van de gebruikersprompt, wat resulteert in 3D-scènes van willekeurige omvang en complexiteit. Bij diverse prompts en lay-outs produceert SynCity 3000 grote, coherente en gedetailleerde scènes, waarmee de tekortkomingen van eerdere benaderingen voor 3D-scènegeneratie worden aangepakt.
English
We present SynCity 3000, a framework for generating 3D scenes that are globally coherent while enabling fine-grained layout control. Building on the ability of current image-to-3D generators to produce complex 3D assets from a single image, we extend this capability to the scale of entire scenes by adapting the generator to be applicable as a convolutional operator. We achieve this by fine-tuning the model on scene-like data generated by a new synthetic data engine, which we propose to address the scarcity of 3D scene data for training. The convolutional generator is then applied to a dimetric image of the entire scene, generated from the user prompt, resulting in 3D scenes of arbitrary size and complexity. Across diverse prompts and layouts, SynCity 3000 produces large, coherent, and detailed scenes, addressing the shortcomings of prior approaches to 3D scene generation.