Relire : les MLLMs pré-entraînés sont des modèles de récompense zero-shot pour la génération texte-image

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

July 13, 2026
Auteurs: Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao
cs.AI

Résumé

Dans cet article, nous proposons SpectraReward, une fonction de récompense sans entraînement qui transforme les MLLMs pré-entraînés en modèles de récompense prêts à l'emploi pour l'apprentissage par renforcement appliqué à la génération d'images. Au lieu de demander au MLLM d'évaluer une image générée ou de répondre à des questions de vérification décomposées, SpectraReward mesure dans quelle mesure le prompt original peut être reconstruit à partir de l'image générée via un seul passage avant conditionné par l'image et forcé par l'enseignant. Nous utilisons la vraisemblance logarithmique moyenne du prompt conditionné par l'image comme récompense, réutilisant directement la capacité d'alignement texte-image pré-entraînée du MLLM sans recourir à des étiquettes de préférence ni à un fine-tuning du modèle de récompense. Nous introduisons également Self-SpectraReward, un cas particulier pour les modèles multimodaux unifiés où la propre branche de compréhension de la politique sert de modèle de récompense pour sa branche de génération, formant ainsi un cadre d'auto-amélioration en boucle fermée, sans modèle de récompense externe ni connaissance externe. Des expériences approfondies valident SpectraReward à travers une large étude de RL pour la génération d'images, couvrant deux modèles de diffusion, trois algorithmes de RL, neuf architectures de MLLM de récompense issues de quatre familles de MLLM allant de 4 à 235 milliards de paramètres, ainsi que cinq bancs d'essai texte-à-image hors distribution. Les résultats montrent que SpectraReward et Self-SpectraReward améliorent tous deux de manière significative et constante les performances de génération, surpassant les méthodes antérieures d'entraînement de récompense dérivées des MLLM. Une analyse plus poussée révèle que des MLLM de récompense plus grands ne sont pas toujours meilleurs, tandis que Self-SpectraReward peut égaler ou surpasser des modèles de récompense externes bien plus grands, suggérant que l'alignement récompense-politique est un facteur clé pour un RL efficace en génération d'images. Page du projet : https://huangrh99.github.io/SpectraReward/
English
In this paper, we propose SpectraReward, a training-free reward function that turns pretrained MLLMs into off-the-shelf reward models for image-generation reinforcement learning. Instead of asking the MLLM to judge a generated image or answer decomposed verification questions, SpectraReward measures how well the original prompt can be recovered from the generated image through a single image-conditioned, teacher-forced forward pass. We use the average image-conditioned prompt log-likelihood as the reward, directly reusing the MLLM's pretrained image-text alignment ability without preference labels, reward-model fine-tuning. We further introduce Self-SpectraReward, a special case for unified multimodal models where the policy's own understanding branch serves as the reward model for its generation branch, forming a closed-loop self-improving framework without external reward models or external knowledge. Extensive experiments validate SpectraReward through a broad image-generation RL study covering two diffusion models, three RL algorithms, nine reward MLLM backbones from four MLLM families spanning 4B to 235B parameters, and five out-of-distribution text-to-image benchmarks. Results show that both SpectraReward and Self-SpectraReward significantly and consistently improve generation performance and outperform prior MLLM-derived reward training methods. Further analysis reveals that larger reward MLLMs are not always better, while Self-SpectraReward can match or surpass much larger external reward models, suggesting that reward-policy alignment is a key factor for effective image-generation RL. Project Page: https://huangrh99.github.io/SpectraReward/
PDF422July 16, 2026