Relatório Técnico do Qwen-Image-2.0-RL
Qwen-Image-2.0-RL Technical Report
June 25, 2026
Autores: Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu
cs.AI
Resumo
Apresentamos o Qwen-Image-2.0-RL, um pipeline de pós-treinamento que aplica aprendizado por reforço a partir de feedback humano (RLHF) e destilação on-policy (OPD) para melhorar tanto a qualidade visual quanto a capacidade de seguir instruções do modelo de difusão Qwen-Image-2.0. Para fornecer sinais de recompensa confiáveis, construímos modelos de recompensa compostos específicos para cada tarefa, ajustando modelos de visão-linguagem com um paradigma de pontuação pointwise e raciocínio em cadeia de pensamento. Para geração de texto para imagem, os modelos de recompensa abrangem dimensões de alinhamento, estética e fidelidade de retrato. Para tarefas de edição de imagem, o sistema de recompensa aborda a precisão no seguimento de instruções e a preservação da identidade facial. Com base nesse sistema de recompensa, desenvolvemos uma estrutura de treinamento RL escalável baseada em GRPO, incorporando uma estratégia híbrida de orientação livre de classificador (CFG) para preservar o conhecimento pré-treinado, curadoria de prompts via filtragem por intervalo de recompensa intra-grupo e calibração de pesos de recompensa por categoria. Para unificar as políticas de RL especializadas em tarefas de T2I e edição, propomos a destilação on-policy como estágio final de treinamento, que consolida múltiplos professores em um único modelo estudante por meio da correspondência de velocidade em nível de trajetória. Uma avaliação extensa mostra que o Qwen-Image-2.0-RL alcança uma pontuação geral de 57,84 no Qwen-Image-Bench (+2,61 em relação ao modelo base), classificações Elo de 1193 na arena de texto para imagem (+78) e 1349 na arena de edição de imagem (+93), demonstrando ganhos consistentes em qualidade estética, aderência ao prompt e precisão de edição.
English
We present Qwen-Image-2.0-RL, a post-training pipeline that applies reinforcement learning from human feedback (RLHF) and on-policy distillation (OPD) to improve both the visual quality and instruction-following capability of the Qwen-Image-2.0 diffusion model. To provide reliable reward signals, we construct task-specific composite reward models by fine-tuning vision-language models with a pointwise scoring paradigm and chain-of-thought reasoning. For text-to-image generation, the reward models cover alignment, aesthetics, and portrait fidelity dimensions. For image editing tasks, the reward system addresses instruction-following accuracy and face identity preservation. Building on this reward system, we develop a scalable GRPO-based RL training framework, incorporating a hybrid classifier-free guidance (CFG) strategy to preserve pre-trained knowledge, prompt curation via intra-group reward range filtering, and per-category reward weight calibration. To merge the task-specialized RL policies for T2I and editing, we propose on-policy distillation as the final training stage, which consolidates multiple teachers into a single student model through trajectory-level velocity matching. Extensive evaluation shows that Qwen-Image-2.0-RL achieves 57.84 overall score on Qwen-Image-Bench (+2.61 over the base model), Elo ratings of 1193 in text-to-image arena (+78) and 1349 in image edit arena (+93), demonstrating consistent gains in aesthetic quality, prompt adherence, and editing accuracy.