SynCity 3000: Бустреппинг трехмерной диффузии в масштабе сцены
SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion
July 6, 2026
Авторы: Paul Engstler, Iro Laina, Christian Rupprecht, Andrea Vedaldi
cs.AI
Аннотация
Мы представляем SynCity 3000 — фреймворк для генерации 3D-сцен, которые являются глобально согласованными и при этом обеспечивают детальный контроль компоновки. Опираясь на способность современных генераторов изображений в 3D создавать сложные 3D-объекты на основе одного изображения, мы расширяем эту возможность до масштаба целых сцен, адаптируя генератор для применения в качестве сверточного оператора. Этого мы достигаем путем тонкой настройки модели на данных, имитирующих сцены, которые генерируются новым движком синтетических данных, предлагаемым нами для решения проблемы нехватки 3D-данных для обучения. Затем сверточный генератор применяется к диметрическому изображению всей сцены, созданному на основе пользовательского запроса, что позволяет получать 3D-сцены произвольного размера и сложности. На разнообразных запросах и компоновках SynCity 3000 создает крупные, согласованные и детализированные сцены, устраняя недостатки предыдущих подходов к генерации 3D-сцен.
English
We present SynCity 3000, a framework for generating 3D scenes that are globally coherent while enabling fine-grained layout control. Building on the ability of current image-to-3D generators to produce complex 3D assets from a single image, we extend this capability to the scale of entire scenes by adapting the generator to be applicable as a convolutional operator. We achieve this by fine-tuning the model on scene-like data generated by a new synthetic data engine, which we propose to address the scarcity of 3D scene data for training. The convolutional generator is then applied to a dimetric image of the entire scene, generated from the user prompt, resulting in 3D scenes of arbitrary size and complexity. Across diverse prompts and layouts, SynCity 3000 produces large, coherent, and detailed scenes, addressing the shortcomings of prior approaches to 3D scene generation.