ChatPaper.aiChatPaper

Boogu-Image-0.1: Versterking van open-source geünificeerd multimodaal begrip en generatie

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

July 14, 2026
Auteurs: Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei
cs.AI

Samenvatting

Wij introduceren Boogu-Image-0.1, een open-source unified multimodale begrips- en generatiemodelfamilie, bestaande uit de varianten Base, Turbo, Edit en Edit-Turbo. Het levert concurrerende prestaties op het gebied van hoogwaardige tekst-naar-beeld generatie, snelle inferentie, instructiegebaseerd bewerken en tweetalige (Chinees-Engels) tekstweergave. Closed-source multimodale systemen zoals Nano-Banana-Pro en GPT-Image-2 bereiken sterke prestaties door systeemniveau-integratie in plaats van een enkel model, maar hun interne werkwijzen blijven grotendeels onbekend. In dit werk tonen we aan dat gerichte verbeteringen in modelbegrip, datakwaliteit en trainingspijplijnen, gecombineerd met agentische inferentietijd-schaling, de generatie- en bewerkingsprestaties aanzienlijk kunnen verbeteren, zelfs onder zeer beperkte rekenbudgetten. Uitgebreide evaluaties tonen aan dat Boogu-Image-0.1 consequent andere open-source modellen evenaart of overtreft op standaard benchmarks, en resultaten behaalt die de toonaangevende closed-source systemen benaderen. Opmerkelijk is dat dit wordt bereikt met slechts 208,62 miljoen unieke afbeeldingen. De theoretische trainingskosten van het basismodel bedragen slechts ongeveer 400.000 USD. We delen praktische discussies waarvan we denken dat ze waardevol zijn voor de bredere onderzoeksgemeenschap, en geven gewichten, code en recepten vrij onder Apache 2.0 om het open ecosysteem voor unified multimodale begrip en generatie te bevorderen. Onze code is hier beschikbaar: https://github.com/Boogu-Project/Boogu-Image.
English
We introduce Boogu-Image-0.1, an open-source unified multimodal understanding and generation model family, comprising Base, Turbo, Edit, and Edit-Turbo variants. It delivers competitive performance in high-quality text-to-image generation, fast inference, instruction-based editing, and bilingual (Chinese-English) text rendering. Closed-source multimodal systems like Nano-Banana-Pro and GPT-Image-2 achieve strong performance through system-level integration rather than a single model, yet their internal practices remain largely undisclosed. In this work, we demonstrate that targeted improvements in model understanding, data quality, and training pipelines, coupled with agentic inference-time scaling, can substantially enhance generation and editing performance even under highly constrained compute budgets. Comprehensive evaluations show that Boogu-Image-0.1 consistently matches or surpasses other open-source models across standard benchmarks, and achieves results approaching leading closed-source systems. Notably, this is accomplished with only 208.62 million unique images. The base model's theoretical training cost is only approximately \$400K. We share practical discussions that we believe are valuable to the broader research community, and release weights, code, and recipes under Apache 2.0 to advance the open ecosystem for unified multimodal understanding and generation. Our code is available here: https://github.com/Boogu-Project/Boogu-Image.