Boogu-Image-0.1: Potenciando la Comprensión y Generación Multimodal Unificada de Código Abierto
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
July 14, 2026
Autores: Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei
cs.AI
Resumen
Presentamos Boogu-Image-0.1, una familia de modelos unificados de comprensión y generación multimodal de código abierto, que incluye las variantes Base, Turbo, Edit y Edit-Turbo. Ofrece un rendimiento competitivo en generación de texto a imagen de alta calidad, inferencia rápida, edición basada en instrucciones y generación de texto bilingüe (chino-inglés). Los sistemas multimodales de código cerrado como Nano-Banana-Pro y GPT-Image-2 logran un rendimiento sólido mediante integración a nivel de sistema en lugar de un modelo único, aunque sus prácticas internas permanecen en gran medida sin divulgar. En este trabajo demostramos que mejoras específicas en la comprensión del modelo, la calidad de los datos y los pipelines de entrenamiento, junto con el escalado de inferencia mediante agentes, pueden potenciar sustancialmente el rendimiento en generación y edición incluso bajo presupuestos computacionales muy restringidos. Evaluaciones exhaustivas muestran que Boogu-Image-0.1 iguala o supera consistentemente a otros modelos de código abierto en los benchmarks estándar, y alcanza resultados cercanos a los sistemas líderes de código cerrado. Notablemente, esto se logra con solo 208.62 millones de imágenes únicas. El costo teórico de entrenamiento del modelo base es de aproximadamente 400 mil dólares. Compartimos discusiones prácticas que consideramos valiosas para la comunidad investigadora en general, y publicamos los pesos, el código y las recetas bajo licencia Apache 2.0 para impulsar el ecosistema abierto de comprensión y generación multimodal unificada. Nuestro código está disponible aquí: https://github.com/Boogu-Project/Boogu-Image.
English
We introduce Boogu-Image-0.1, an open-source unified multimodal understanding and generation model family, comprising Base, Turbo, Edit, and Edit-Turbo variants. It delivers competitive performance in high-quality text-to-image generation, fast inference, instruction-based editing, and bilingual (Chinese-English) text rendering. Closed-source multimodal systems like Nano-Banana-Pro and GPT-Image-2 achieve strong performance through system-level integration rather than a single model, yet their internal practices remain largely undisclosed. In this work, we demonstrate that targeted improvements in model understanding, data quality, and training pipelines, coupled with agentic inference-time scaling, can substantially enhance generation and editing performance even under highly constrained compute budgets. Comprehensive evaluations show that Boogu-Image-0.1 consistently matches or surpasses other open-source models across standard benchmarks, and achieves results approaching leading closed-source systems. Notably, this is accomplished with only 208.62 million unique images. The base model's theoretical training cost is only approximately \$400K. We share practical discussions that we believe are valuable to the broader research community, and release weights, code, and recipes under Apache 2.0 to advance the open ecosystem for unified multimodal understanding and generation. Our code is available here: https://github.com/Boogu-Project/Boogu-Image.