Boogu-Image-0.1: Verbesserung des offenen, vereinheitlichten multimodalen Verständnisses und der Generierung
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
July 14, 2026
Autoren: Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei
cs.AI
Zusammenfassung
Wir stellen Boogu-Image-0.1 vor, eine quelloffene Familie einheitlicher multimodaler Verständnis- und Generierungsmodelle, bestehend aus den Varianten Base, Turbo, Edit und Edit-Turbo. Es bietet wettbewerbsfähige Leistung bei hochwertiger Text-zu-Bild-Generierung, schneller Inferenz, instruktionsbasierter Bearbeitung und zweisprachiger (Chinesisch-Englisch) Textwiedergabe. Geschlossene multimodale Systeme wie Nano-Banana-Pro und GPT-Image-2 erzielen starke Ergebnisse durch systemweite Integration anstelle eines einzelnen Modells, doch ihre internen Verfahren bleiben weitgehend unveröffentlicht. In dieser Arbeit zeigen wir, dass gezielte Verbesserungen im Modellverständnis, in der Datenqualität und in den Trainingspipelines, kombiniert mit agentischem Inference-Time-Scaling, selbst unter stark eingeschränkten Rechenbudgets die Generierungs- und Bearbeitungsleistung erheblich steigern können. Umfassende Evaluierungen belegen, dass Boogu-Image-0.1 auf Standard-Benchmarks durchweg mit anderen quelloffenen Modellen mithält oder diese übertrifft und Ergebnisse nahe führender geschlossener Systeme erzielt. Bemerkenswert ist, dass dies mit nur 208,62 Millionen einzigartigen Bildern erreicht wird. Die theoretischen Trainingskosten des Basismodells betragen lediglich etwa 400.000 US-Dollar. Wir teilen praktische Diskussionen, die wir für die breitere Forschungsgemeinschaft als wertvoll erachten, und veröffentlichen Gewichte, Code und Rezepte unter Apache 2.0, um das offene Ökosystem für einheitliches multimodales Verständnis und Generierung voranzutreiben. Unser Code ist hier verfügbar: https://github.com/Boogu-Project/Boogu-Image.
English
We introduce Boogu-Image-0.1, an open-source unified multimodal understanding and generation model family, comprising Base, Turbo, Edit, and Edit-Turbo variants. It delivers competitive performance in high-quality text-to-image generation, fast inference, instruction-based editing, and bilingual (Chinese-English) text rendering. Closed-source multimodal systems like Nano-Banana-Pro and GPT-Image-2 achieve strong performance through system-level integration rather than a single model, yet their internal practices remain largely undisclosed. In this work, we demonstrate that targeted improvements in model understanding, data quality, and training pipelines, coupled with agentic inference-time scaling, can substantially enhance generation and editing performance even under highly constrained compute budgets. Comprehensive evaluations show that Boogu-Image-0.1 consistently matches or surpasses other open-source models across standard benchmarks, and achieves results approaching leading closed-source systems. Notably, this is accomplished with only 208.62 million unique images. The base model's theoretical training cost is only approximately \$400K. We share practical discussions that we believe are valuable to the broader research community, and release weights, code, and recipes under Apache 2.0 to advance the open ecosystem for unified multimodal understanding and generation. Our code is available here: https://github.com/Boogu-Project/Boogu-Image.