Boogu-Image-0.1 : Amélioration de la compréhension et génération multimodale unifiée open-source

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

July 14, 2026
Auteurs: Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei
cs.AI

Résumé

Nous présentons Boogu-Image-0.1, une famille de modèles open source unifiés pour la compréhension et la génération multimodales, comprenant les variantes Base, Turbo, Edit et Edit-Turbo. Elle offre des performances compétitives en matière de génération texte-image de haute qualité, d'inférence rapide, d'édition basée sur des instructions et de rendu de texte bilingue (chinois-anglais). Les systèmes multimodaux fermés tels que Nano-Banana-Pro et GPT-Image-2 atteignent de hautes performances grâce à une intégration au niveau du système plutôt qu'à un modèle unique, mais leurs pratiques internes restent largement confidentielles. Dans ce travail, nous démontrons que des améliorations ciblées dans la compréhension du modèle, la qualité des données et les pipelines d'entraînement, associées à un passage à l'échelle au moment de l'inférence basé sur un agent, peuvent considérablement améliorer les performances de génération et d'édition, même sous des budgets de calcul très contraints. Des évaluations complètes montrent que Boogu-Image-0.1 égale ou dépasse systématiquement les autres modèles open source sur des benchmarks standard, et atteint des résultats proches des systèmes fermés de premier plan. Notamment, cela est accompli avec seulement 208,62 millions d'images uniques. Le coût théorique d'entraînement du modèle de base n'est que d'environ 400 000 $. Nous partageons des discussions pratiques que nous estimons précieuses pour la communauté de recherche élargie, et publions les poids, le code et les recettes sous licence Apache 2.0 afin de faire progresser l'écosystème ouvert pour la compréhension et la génération multimodales unifiées. Notre code est disponible ici : https://github.com/Boogu-Project/Boogu-Image.
English
We introduce Boogu-Image-0.1, an open-source unified multimodal understanding and generation model family, comprising Base, Turbo, Edit, and Edit-Turbo variants. It delivers competitive performance in high-quality text-to-image generation, fast inference, instruction-based editing, and bilingual (Chinese-English) text rendering. Closed-source multimodal systems like Nano-Banana-Pro and GPT-Image-2 achieve strong performance through system-level integration rather than a single model, yet their internal practices remain largely undisclosed. In this work, we demonstrate that targeted improvements in model understanding, data quality, and training pipelines, coupled with agentic inference-time scaling, can substantially enhance generation and editing performance even under highly constrained compute budgets. Comprehensive evaluations show that Boogu-Image-0.1 consistently matches or surpasses other open-source models across standard benchmarks, and achieves results approaching leading closed-source systems. Notably, this is accomplished with only 208.62 million unique images. The base model's theoretical training cost is only approximately \$400K. We share practical discussions that we believe are valuable to the broader research community, and release weights, code, and recipes under Apache 2.0 to advance the open ecosystem for unified multimodal understanding and generation. Our code is available here: https://github.com/Boogu-Project/Boogu-Image.
PDF1072July 17, 2026