Releia: MLLMs Pré-treinados São Modelos de Recompensa Zero-Shot para Geração de Texto para Imagem
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
July 13, 2026
Autores: Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao
cs.AI
Resumo
Neste artigo, propomos o SpectraReward, uma função de recompensa livre de treinamento que transforma MLLMs pré-treinados em modelos de recompensa prontos para uso em aprendizado por reforço para geração de imagens. Em vez de solicitar que o MLLM julgue uma imagem gerada ou responda a perguntas de verificação decompostas, o SpectraReward mede o quão bem o prompt original pode ser recuperado a partir da imagem gerada por meio de uma única passagem direta condicionada por imagem e forçada pelo professor. Utilizamos a log-verossimilhança média do prompt condicionado pela imagem como recompensa, reutilizando diretamente a capacidade de alinhamento imagem-texto pré-treinada do MLLM, sem necessidade de rótulos de preferência ou ajuste fino do modelo de recompensa. Introduzimos ainda o Self-SpectraReward, um caso especial para modelos multimodais unificados, no qual o próprio ramo de compreensão da política serve como modelo de recompensa para seu ramo de geração, formando uma estrutura de autoaperfeiçoamento em malha fechada, sem modelos de recompensa externos ou conhecimento externo. Extensos experimentos validam o SpectraReward por meio de um amplo estudo de RL para geração de imagens, abrangendo dois modelos de difusão, três algoritmos de RL, nove backbones de MLLM de recompensa de quatro famílias de MLLM com parâmetros de 4B a 235B, e cinco benchmarks de texto-para-imagem fora da distribuição. Os resultados mostram que tanto o SpectraReward quanto o Self-SpectraReward melhoram significativa e consistentemente o desempenho da geração, superando métodos anteriores de treinamento de recompensa derivados de MLLM. Análises adicionais revelam que MLLMs de recompensa maiores nem sempre são melhores, enquanto o Self-SpectraReward pode igualar ou superar modelos de recompensa externos muito maiores, sugerindo que o alinhamento entre recompensa e política é um fator chave para a eficácia da RL na geração de imagens. Página do projeto: https://huangrh99.github.io/SpectraReward/
English
In this paper, we propose SpectraReward, a training-free reward function that turns pretrained MLLMs into off-the-shelf reward models for image-generation reinforcement learning. Instead of asking the MLLM to judge a generated image or answer decomposed verification questions, SpectraReward measures how well the original prompt can be recovered from the generated image through a single image-conditioned, teacher-forced forward pass. We use the average image-conditioned prompt log-likelihood as the reward, directly reusing the MLLM's pretrained image-text alignment ability without preference labels, reward-model fine-tuning. We further introduce Self-SpectraReward, a special case for unified multimodal models where the policy's own understanding branch serves as the reward model for its generation branch, forming a closed-loop self-improving framework without external reward models or external knowledge. Extensive experiments validate SpectraReward through a broad image-generation RL study covering two diffusion models, three RL algorithms, nine reward MLLM backbones from four MLLM families spanning 4B to 235B parameters, and five out-of-distribution text-to-image benchmarks. Results show that both SpectraReward and Self-SpectraReward significantly and consistently improve generation performance and outperform prior MLLM-derived reward training methods. Further analysis reveals that larger reward MLLMs are not always better, while Self-SpectraReward can match or surpass much larger external reward models, suggesting that reward-policy alignment is a key factor for effective image-generation RL. Project Page: https://huangrh99.github.io/SpectraReward/