Despertando a Inteligência Espacial na Compreensão e Geração Multimodal Unificada
Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
May 5, 2026
Autores: Lin Song, Wenbo Li, Guoqing Ma, Wei Tang, Bo Wang, Yuan Zhang, Yijun Yang, Yicheng Xiao, Jianhui Liu, Yanbing Zhang, Guohui Zhang, Wenhu Zhang, Hang Xu, Nan Jiang, Xin Han, Haoze Sun, Maoquan Zhang, Haoyang Huang, Nan Duan
cs.AI
Resumo
Apresentamos o JoyAI-Image, um modelo de base multimodal unificado para compreensão visual, geração de imagens a partir de texto e edição de imagens guiada por instruções. O JoyAI-Image acopla um Modelo de Linguagem Grande Multimodal (MLLM) espacialmente aprimorado com um Transformer de Difusão Multimodal (MMDiT), permitindo que a perceção e a geração interajam através de uma interface multimodal partilhada. Em torno desta arquitetura, construímos uma receita de treino escalável que combina *fine-tuning* unificado por instruções, supervisão de renderização de texto longo, dados com fundamentação espacial e sinais de edição gerais e espaciais. Este projeto confere ao modelo uma ampla capacidade multimodal, ao mesmo tempo que reforça o raciocínio com consciência geométrica e a síntese visual controlável. Experiências em benchmarks de compreensão, geração, renderização de texto longo e edição mostram que o JoyAI-Image atinge um desempenho de última geração ou altamente competitivo. Mais importante ainda, o ciclo bidirecional entre a compreensão aprimorada, a edição espacial controlável e o raciocínio assistido por novas perspetivas permite que o modelo vá além da competência visual geral em direção a uma inteligência espacial mais forte. Estes resultados sugerem um caminho promissor para modelos visuais unificados em aplicações a jusante, como sistemas visão-linguagem-ação e modelos do mundo.
English
We present JoyAI-Image, a unified multimodal foundation model for visual understanding, text-to-image generation, and instruction-guided image editing. JoyAI-Image couples a spatially enhanced Multimodal Large Language Model (MLLM) with a Multimodal Diffusion Transformer (MMDiT), allowing perception and generation to interact through a shared multimodal interface. Around this architecture, we build a scalable training recipe that combines unified instruction tuning, long-text rendering supervision, spatially grounded data, and both general and spatial editing signals. This design gives the model broad multimodal capability while strengthening geometry-aware reasoning and controllable visual synthesis. Experiments across understanding, generation, long-text rendering, and editing benchmarks show that JoyAI-Image achieves state-of-the-art or highly competitive performance. More importantly, the bidirectional loop between enhanced understanding, controllable spatial editing, and novel-view-assisted reasoning enables the model to move beyond general visual competence toward stronger spatial intelligence. These results suggest a promising path for unified visual models in downstream applications such as vision-language-action systems and world models.