ChatPaper.aiChatPaper

Rapport Technique de Qwen-Image-2.0

Qwen-Image-2.0 Technical Report

May 11, 2026
Auteurs: Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kuan Cao, Kun Yan, Liang Peng, Lihan Jiang, Niantong Li, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Xihua Wang, Yan Shu, Yanran Zhang, Yi Wang, Yilei Chen, Ying Ba, Yixian Xu, Yujia Wu, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, An Yang, Chen Cheng, Chenxu Lv, Dayiheng Liu, Fan Zhou, Hantian Xiong, Hongzhu Shi, Hu Wei, Huihong Zhao, Ivy Liu, Jianwei Zhang, Jiawei Zhang, Kai Chen, Kang He, Levon Xue, Lin Qu, Linhan Tang, Luwen Feng, Minggang Wu, Minmin Sun, Na Ni, Rui Men, Shuai Bai, Sishou Zheng, Tao Lan, Tianqi Zhang, Tingkun Wen, Wei Wang, Weixu Qiao, Weiyi Lu, Wenmeng Zhou, Xiaodong Deng, Xiaoxiao Xu, Xinlei Fang, Xionghui Chen, Yanan Wang, Yang Fan, Yichang Zhang, Yixuan Xu, Yu Wu, Zhiyuan Ma, Zhizhi Cai
cs.AI

Résumé

Nous présentons Qwen-Image-2.0, un modèle fondateur de génération d'images polyvalent qui unifie la génération haute fidélité et l'édition précise d'images dans un cadre unique. Malgré les progrès récents, les modèles existants peinent encore avec le rendu de texte ultra-long, la typographie multilingue, le photoréalisme haute résolution, le suivi robuste des instructions et le déploiement efficace, en particulier dans les scénarios riches en texte et compositionnellement complexes. Qwen-Image-2.0 relève ces défis en couplant Qwen3-VL comme encodeur de condition avec un Transformeur de Diffusion Multimodal pour la modélisation conjointe condition-cible, soutenu par une curation de données à grande échelle et un pipeline d'entraînement multi-étapes personnalisé. Cela permet une compréhension multimodale solide tout en préservant des capacités de génération et d'édition flexibles. Le modèle prend en charge des instructions allant jusqu'à 1 000 tokens pour générer du contenu riche en texte comme des diapositives, des affiches, des infographies et des bandes dessinées, tout en améliorant significativement la fidélité du texte multilingue et la typographie. Il améliore également la génération photoréaliste avec des détails plus riches, des textures plus réalistes et un éclairage cohérent, et suit plus fidèlement des instructions complexes à travers divers styles. Des évaluations humaines approfondies montrent que Qwen-Image-2.0 surpasse largement les modèles Qwen-Image précédents en génération et en édition, marquant une avancée vers des modèles fondateurs de génération d'images plus généraux, fiables et pratiques.
English
We present Qwen-Image-2.0, an omni-capable image generation foundation model that unifies high-fidelity generation and precise image editing within a single framework. Despite recent progress, existing models still struggle with ultra-long text rendering, multilingual typography, high-resolution photorealism, robust instruction following, and efficient deployment, especially in text-rich and compositionally complex scenarios. Qwen-Image-2.0 addresses these challenges by coupling Qwen3-VL as the condition encoder with a Multimodal Diffusion Transformer for joint condition-target modeling, supported by large-scale data curation and a customized multi-stage training pipeline. This enables strong multimodal understanding while preserving flexible generation and editing capabilities. The model supports instructions of up to 1K tokens for generating text-rich content such as slides, posters, infographics, and comics, while significantly improving multilingual text fidelity and typography. It also enhances photorealistic generation with richer details, more realistic textures, and coherent lighting, and follows complex prompts more reliably across diverse styles. Extensive human evaluations show that Qwen-Image-2.0 substantially outperforms previous Qwen-Image models in both generation and editing, marking a step toward more general, reliable, and practical image generation foundation models.