ChatPaper.aiChatPaper

SynCity 3000 : Amorçage de la diffusion 3D à l'échelle de la scène

SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion

July 6, 2026
Auteurs: Paul Engstler, Iro Laina, Christian Rupprecht, Andrea Vedaldi
cs.AI

Résumé

Nous présentons SynCity 3000, un cadre de génération de scènes 3D globalement cohérentes tout en permettant un contrôle fin de la disposition. En nous appuyant sur la capacité des générateurs image-3D actuels à produire des actifs 3D complexes à partir d’une seule image, nous étendons cette capacité à l’échelle de scènes entières en adaptant le générateur pour qu’il soit applicable comme opérateur convolutif. Pour ce faire, nous affinons le modèle sur des données de type scène générées par un nouveau moteur de données synthétiques, que nous proposons pour pallier la rareté des données de scènes 3D nécessaires à l’entraînement. Le générateur convolutif est ensuite appliqué à une image dimétrique de la scène entière, générée à partir du prompt utilisateur, produisant ainsi des scènes 3D de taille et de complexité arbitraires. Sur divers prompts et dispositions, SynCity 3000 génère des scènes vastes, cohérentes et détaillées, répondant aux lacunes des approches antérieures de génération de scènes 3D.
English
We present SynCity 3000, a framework for generating 3D scenes that are globally coherent while enabling fine-grained layout control. Building on the ability of current image-to-3D generators to produce complex 3D assets from a single image, we extend this capability to the scale of entire scenes by adapting the generator to be applicable as a convolutional operator. We achieve this by fine-tuning the model on scene-like data generated by a new synthetic data engine, which we propose to address the scarcity of 3D scene data for training. The convolutional generator is then applied to a dimetric image of the entire scene, generated from the user prompt, resulting in 3D scenes of arbitrary size and complexity. Across diverse prompts and layouts, SynCity 3000 produces large, coherent, and detailed scenes, addressing the shortcomings of prior approaches to 3D scene generation.