Rapport technique de Qwen-Image-VAE-2.0
Qwen-Image-VAE-2.0 Technical Report
May 13, 2026
Auteurs: Zekai Zhang, Deqing Li, Kuan Cao, Yujia Wu, Chenfei Wu, Yu Wu, Liang Peng, Hao Meng, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Yiliang Gu, Yi Wang, Xiaoxiao Xu, Lin Qu
cs.AI
Résumé
Nous présentons Qwen-Image-VAE-2.0, une suite d'autoencodeurs variationnels (VAE) à haute compression qui réalisent des avancées significatives tant en fidélité de reconstruction qu'en diffusabilité. Pour remédier aux goulots d'étranglement de reconstruction liés à la haute compression, nous adoptons une architecture améliorée comportant des connexions de saut globales (GSC) et des canaux latents élargis. De plus, nous passons à l'échelle l'entraînement sur des milliards d'images et intégrons un moteur de rendu synthétique pour améliorer les performances dans les scénarios riches en texte. Pour relever les défis de convergence de l'espace latent de haute dimension, nous mettons en œuvre une stratégie d'alignement sémantique améliorée afin de rendre l'espace latent hautement propice à la modélisation par diffusion. Afin d'optimiser l'efficacité computationnelle, nous tirons parti d'un backbone encodeur-décodeur asymétrique et sans attention pour minimiser la surcharge d'encodage. Nous présentons une évaluation complète de Qwen-Image-VAE-2.0 sur des benchmarks publics de reconstruction. Pour évaluer les performances dans les scénarios riches en texte, nous proposons OmniDoc-TokenBench, un nouveau benchmark comprenant une collection diversifiée de documents du monde réel associée à des métriques d'évaluation spécialisées basées sur l'OCR. Qwen-Image-VAE-2.0 atteint des performances de reconstruction de pointe, démontrant des capacités exceptionnelles tant dans les domaines généraux que dans les scénarios riches en texte avec un taux de compression élevé. De plus, des expériences en aval sur DiT révèlent que nos modèles possèdent une diffusabilité supérieure, accélérant significativement la convergence par rapport aux références existantes à haute compression. Cela établit Qwen-Image-VAE-2.0 comme un modèle de premier plan offrant une compression élevée, une reconstruction supérieure et une diffusabilité exceptionnelle.
English
We present Qwen-Image-VAE-2.0, a suite of high-compression Variational Autoencoders (VAEs) that achieve significant advances in both reconstruction fidelity and diffusability. To address the reconstruction bottlenecks of high compression, we adopt an improved architecture featuring Global Skip Connections (GSC) and expanded latent channels. Moreover, we scale training to billions of images and incorporate a synthetic rendering engine to improve performance in text-rich scenarios. To tackle the convergence challenges of high-dimensional latent space, we implement an enhanced semantic alignment strategy to make the latent space highly amenable to diffusion modeling. To optimize computational efficiency, we leverage an asymmetric and attention-free encoder-decoder backbone to minimize encoding overhead. We present a comprehensive evaluation of Qwen-Image-VAE-2.0 on public reconstruction benchmarks. To evaluate performance in text-rich scenarios, we propose OmniDoc-TokenBench, a new benchmark comprising a diverse collection of real-world documents coupled with specialized OCR-based evaluation metrics. Qwen-Image-VAE-2.0 achieves state-of-the-art reconstruction performance, demonstrating exceptional capabilities in both general domains and text-rich scenarios at high compression ratio. Furthermore, downstream DiT experiments reveal our models possess superior diffusability, significantly accelerating convergence compared to existing high-compression baselines. These establish Qwen-Image-VAE-2.0 as a leading model with high compression, superior reconstruction, and exceptional diffusability.