Boogu-Image-0.1: Усиление открытого унифицированного мультимодального понимания и генерации

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

July 14, 2026
Авторы: Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei
cs.AI

Аннотация

Мы представляем Boogu-Image-0.1 — семейство моделей с открытым исходным кодом для унифицированного мультимодального понимания и генерации, включающее варианты Base, Turbo, Edit и Edit-Turbo. Оно демонстрирует конкурентоспособную производительность в высококачественной генерации изображений по текстовому описанию, быстром логическом выводе, редактировании на основе инструкций и двуязычном (китайско-английском) рендеринге текста. Закрытые мультимодальные системы, такие как Nano-Banana-Pro и GPT-Image-2, достигают высокой производительности за счет системной интеграции, а не отдельной модели, однако их внутренние практики остаются в значительной степени нераскрытыми. В данной работе мы показываем, что целенаправленные улучшения в понимании модели, качестве данных и конвейерах обучения в сочетании с агентным масштабированием во время логического вывода могут существенно повысить производительность генерации и редактирования даже при крайне ограниченных вычислительных бюджетах. Всесторонние оценки показывают, что Boogu-Image-0.1 последовательно соответствует или превосходит другие модели с открытым исходным кодом по стандартным бенчмаркам и достигает результатов, приближающихся к ведущим закрытым системам. Примечательно, что это достигается с использованием всего 208,62 миллиона уникальных изображений. Теоретическая стоимость обучения базовой модели составляет всего около $400 000. Мы делимся практическими обсуждениями, которые, по нашему мнению, представляют ценность для широкого научного сообщества, и публикуем веса, код и рецепты под лицензией Apache 2.0 для развития открытой экосистемы унифицированного мультимодального понимания и генерации. Наш код доступен здесь: https://github.com/Boogu-Project/Boogu-Image.
English
We introduce Boogu-Image-0.1, an open-source unified multimodal understanding and generation model family, comprising Base, Turbo, Edit, and Edit-Turbo variants. It delivers competitive performance in high-quality text-to-image generation, fast inference, instruction-based editing, and bilingual (Chinese-English) text rendering. Closed-source multimodal systems like Nano-Banana-Pro and GPT-Image-2 achieve strong performance through system-level integration rather than a single model, yet their internal practices remain largely undisclosed. In this work, we demonstrate that targeted improvements in model understanding, data quality, and training pipelines, coupled with agentic inference-time scaling, can substantially enhance generation and editing performance even under highly constrained compute budgets. Comprehensive evaluations show that Boogu-Image-0.1 consistently matches or surpasses other open-source models across standard benchmarks, and achieves results approaching leading closed-source systems. Notably, this is accomplished with only 208.62 million unique images. The base model's theoretical training cost is only approximately \$400K. We share practical discussions that we believe are valuable to the broader research community, and release weights, code, and recipes under Apache 2.0 to advance the open ecosystem for unified multimodal understanding and generation. Our code is available here: https://github.com/Boogu-Project/Boogu-Image.
PDF1072July 17, 2026