Map2World: Geração de Mundos 3D Condicionada por Mapas Segmentados
Map2World: Segment Map Conditioned Text to 3D World Generation
May 1, 2026
Autores: Jaeyoung Chung, Suyoung Lee, Jianfeng Xiang, Jiaolong Yang, Kyoung Mu Lee
cs.AI
Resumo
A geração de mundos 3D é essencial para aplicações como a criação de conteúdo imersivo ou a simulação de condução autónoma. Avanços recentes na geração de mundos 3D têm mostrado resultados promissores; no entanto, estes métodos estão limitados por layouts de grelha e sofrem de inconsistências na escala dos objetos ao longo de todo o mundo. Neste trabalho, introduzimos uma nova estrutura, o Map2World, que permite, pela primeira vez, a geração de mundos 3D condicionada a mapas de segmentos de formas e escalas arbitrárias definidos pelo utilizador, garantindo consistência de escala global e flexibilidade em ambientes expansivos. Para melhorar ainda mais a qualidade, propomos uma rede de aperfeiçoamento de detalhes que gera pormenores finos do mundo. O aperfeiçoador de detalhes permite a adição de pormenores granulares sem comprometer a coerência geral da cena, incorporando informações da estrutura global. Concebemos todo o *pipeline* para aproveitar fortes *priors* de geradores de *assets*, alcançando uma generalização robusta em diversos domínios, mesmo com dados de treino limitados para a geração de cenários. Experiências extensivas demonstram que o nosso método supera significativamente as abordagens existentes em controlabilidade pelo utilizador, consistência de escala e coerência de conteúdo, permitindo aos utilizadores gerar mundos 3D sob condições mais complexas.
English
3D world generation is essential for applications such as immersive content creation or autonomous driving simulation. Recent advances in 3D world generation have shown promising results; however, these methods are constrained by grid layouts and suffer from inconsistencies in object scale throughout the entire world. In this work, we introduce a novel framework, Map2World, that first enables 3D world generation conditioned on user-defined segment maps of arbitrary shapes and scales, ensuring global-scale consistency and flexibility across expansive environments. To further enhance the quality, we propose a detail enhancer network that generates fine details of the world. The detail enhancer enables the addition of fine-grained details without compromising overall scene coherence by incorporating global structure information. We design the entire pipeline to leverage strong priors from asset generators, achieving robust generalization across diverse domains, even under limited training data for scene generation. Extensive experiments demonstrate that our method significantly outperforms existing approaches in user-controllability, scale consistency, and content coherence, enabling users to generate 3D worlds under more complex conditions.