Read It Back: Los MLLMs preentrenados son modelos de recompensa zero-shot para la generación de texto a imagen
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
July 13, 2026
Autores: Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao
cs.AI
Resumen
En este artículo, proponemos SpectraReward, una función de recompensa sin entrenamiento que convierte a los MLLM preentrenados en modelos de recompensa listos para usar para el aprendizaje por refuerzo en generación de imágenes. En lugar de pedir al MLLM que juzgue una imagen generada o que responda preguntas de verificación descompuestas, SpectraReward mide qué tan bien se puede recuperar la instrucción original a partir de la imagen generada mediante un único pase directo forzado por el profesor condicionado a la imagen. Utilizamos la log-verosimilitud promedio de la instrucción condicionada a la imagen como recompensa, reutilizando directamente la capacidad de alineación imagen-texto preentrenada del MLLM sin etiquetas de preferencia ni ajuste fino del modelo de recompensa. Además, introducimos Self-SpectraReward, un caso especial para modelos multimodales unificados donde la propia rama de comprensión de la política sirve como modelo de recompensa para su rama de generación, formando un marco de auto-mejora en bucle cerrado sin modelos de recompensa externos ni conocimiento externo. Extensos experimentos validan SpectraReward mediante un amplio estudio de RL para generación de imágenes que abarca dos modelos de difusión, tres algoritmos de RL, nueve modelos base MLLM de cuatro familias de MLLM que van de 4B a 235B parámetros, y cinco puntos de referencia de texto a imagen fuera de distribución. Los resultados muestran que tanto SpectraReward como Self-SpectraReward mejoran significativa y consistentemente el rendimiento de generación y superan a métodos anteriores de entrenamiento de recompensas derivados de MLLM. Análisis adicionales revelan que modelos MLLM de recompensa más grandes no siempre son mejores, mientras que Self-SpectraReward puede igualar o superar a modelos de recompensa externos mucho más grandes, lo que sugiere que la alineación recompensa-política es un factor clave para un RL efectivo en generación de imágenes. Página del proyecto: https://huangrh99.github.io/SpectraReward/
English
In this paper, we propose SpectraReward, a training-free reward function that turns pretrained MLLMs into off-the-shelf reward models for image-generation reinforcement learning. Instead of asking the MLLM to judge a generated image or answer decomposed verification questions, SpectraReward measures how well the original prompt can be recovered from the generated image through a single image-conditioned, teacher-forced forward pass. We use the average image-conditioned prompt log-likelihood as the reward, directly reusing the MLLM's pretrained image-text alignment ability without preference labels, reward-model fine-tuning. We further introduce Self-SpectraReward, a special case for unified multimodal models where the policy's own understanding branch serves as the reward model for its generation branch, forming a closed-loop self-improving framework without external reward models or external knowledge. Extensive experiments validate SpectraReward through a broad image-generation RL study covering two diffusion models, three RL algorithms, nine reward MLLM backbones from four MLLM families spanning 4B to 235B parameters, and five out-of-distribution text-to-image benchmarks. Results show that both SpectraReward and Self-SpectraReward significantly and consistently improve generation performance and outperform prior MLLM-derived reward training methods. Further analysis reveals that larger reward MLLMs are not always better, while Self-SpectraReward can match or surpass much larger external reward models, suggesting that reward-policy alignment is a key factor for effective image-generation RL. Project Page: https://huangrh99.github.io/SpectraReward/