ChatPaper.aiChatPaper

Boogu-Image-0.1: Aprimorando a Compreensão e Geração Multimodal Unificada de Código Aberto

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

July 14, 2026
Autores: Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei
cs.AI

Resumo

Apresentamos o Boogu-Image-0.1, uma família de modelos de código aberto para compreensão e geração multimodal unificada, composta pelas variantes Base, Turbo, Edit e Edit-Turbo. Ela oferece desempenho competitivo em geração de imagem a partir de texto de alta qualidade, inferência rápida, edição baseada em instruções e renderização de texto bilíngue (chinês-inglês). Sistemas multimodais fechados, como Nano-Banana-Pro e GPT-Image-2, alcançam forte desempenho por meio de integração em nível de sistema, em vez de um único modelo, mas suas práticas internas permanecem amplamente não divulgadas. Neste trabalho, demonstramos que melhorias direcionadas na compreensão do modelo, na qualidade dos dados e nos pipelines de treinamento, combinadas com escalonamento do tempo de inferência baseado em agentes, podem aprimorar substancialmente o desempenho de geração e edição, mesmo sob orçamentos computacionais altamente restritos. Avaliações abrangentes mostram que o Boogu-Image-0.1 consistentemente iguala ou supera outros modelos de código aberto em benchmarks padrão, e alcança resultados próximos aos principais sistemas fechados. Notavelmente, isso é realizado com apenas 208,62 milhões de imagens únicas. O custo teórico de treinamento do modelo base é de aproximadamente US$ 400 mil. Compartilhamos discussões práticas que consideramos valiosas para a comunidade de pesquisa em geral e disponibilizamos pesos, código e receitas sob a licença Apache 2.0 para avançar o ecossistema aberto de compreensão e geração multimodal unificada. Nosso código está disponível aqui: https://github.com/Boogu-Project/Boogu-Image.
English
We introduce Boogu-Image-0.1, an open-source unified multimodal understanding and generation model family, comprising Base, Turbo, Edit, and Edit-Turbo variants. It delivers competitive performance in high-quality text-to-image generation, fast inference, instruction-based editing, and bilingual (Chinese-English) text rendering. Closed-source multimodal systems like Nano-Banana-Pro and GPT-Image-2 achieve strong performance through system-level integration rather than a single model, yet their internal practices remain largely undisclosed. In this work, we demonstrate that targeted improvements in model understanding, data quality, and training pipelines, coupled with agentic inference-time scaling, can substantially enhance generation and editing performance even under highly constrained compute budgets. Comprehensive evaluations show that Boogu-Image-0.1 consistently matches or surpasses other open-source models across standard benchmarks, and achieves results approaching leading closed-source systems. Notably, this is accomplished with only 208.62 million unique images. The base model's theoretical training cost is only approximately \$400K. We share practical discussions that we believe are valuable to the broader research community, and release weights, code, and recipes under Apache 2.0 to advance the open ecosystem for unified multimodal understanding and generation. Our code is available here: https://github.com/Boogu-Project/Boogu-Image.