Read It Back: Vorgefertigte MLLMs als Zero-Shot-Belohnungsmodelle für die Text-zu-Bild-Generierung
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
July 13, 2026
Autoren: Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao
cs.AI
Zusammenfassung
In diesem Beitrag stellen wir SpectraReward vor, eine trainingsfreie Belohnungsfunktion, die vortrainierte MLLMs zu einsatzbereiten Belohnungsmodellen für das Reinforcement Learning zur Bilderzeugung macht. Anstatt das MLLM ein generiertes Bild bewerten oder zerlegte Verifikationsfragen beantworten zu lassen, misst SpectraReward, wie gut der ursprüngliche Prompt aus dem generierten Bild durch einen einzelnen bildbedingten, lehrergesteuerten Vorwärtsdurchlauf wiederhergestellt werden kann. Wir verwenden die durchschnittliche bildbedingte Prompt-Log-Wahrscheinlichkeit als Belohnung und nutzen dabei direkt die vortrainierte Fähigkeit des MLLM zur Bild-Text-Ausrichtung, ohne Präferenzlabels oder eine Feinabstimmung des Belohnungsmodells. Darüber hinaus führen wir Self-SpectraReward ein, einen Spezialfall für vereinheitlichte multimodale Modelle, bei dem der eigene Verständniszweig der Policy als Belohnungsmodell für deren Generierungszweig dient. Dies bildet ein rückgekoppeltes selbstverbesserndes Framework ohne externe Belohnungsmodelle oder externes Wissen. Umfangreiche Experimente validieren SpectraReward durch eine breite RL-Studie zur Bilderzeugung, die zwei Diffusionsmodelle, drei RL-Algorithmen, neun Belohnungs-MLLM-Backbones aus vier MLLM-Familien mit 4 bis 235 Milliarden Parametern sowie fünf Out-of-Distribution-Text-zu-Bild-Benchmarks umfasst. Die Ergebnisse zeigen, dass sowohl SpectraReward als auch Self-SpectraReward die Generierungsleistung signifikant und konsistent verbessern und frühere auf MLLM basierende Belohnungstrainingsmethoden übertreffen. Weitere Analysen zeigen, dass größere Belohnungs-MLLMs nicht immer besser sind, während Self-SpectraReward mit deutlich größeren externen Belohnungsmodellen mithalten oder diese sogar übertreffen kann. Dies deutet darauf hin, dass die Ausrichtung von Belohnung und Policy ein Schlüsselfaktor für effektives Reinforcement Learning zur Bilderzeugung ist. Projektseite: https://huangrh99.github.io/SpectraReward/
English
In this paper, we propose SpectraReward, a training-free reward function that turns pretrained MLLMs into off-the-shelf reward models for image-generation reinforcement learning. Instead of asking the MLLM to judge a generated image or answer decomposed verification questions, SpectraReward measures how well the original prompt can be recovered from the generated image through a single image-conditioned, teacher-forced forward pass. We use the average image-conditioned prompt log-likelihood as the reward, directly reusing the MLLM's pretrained image-text alignment ability without preference labels, reward-model fine-tuning. We further introduce Self-SpectraReward, a special case for unified multimodal models where the policy's own understanding branch serves as the reward model for its generation branch, forming a closed-loop self-improving framework without external reward models or external knowledge. Extensive experiments validate SpectraReward through a broad image-generation RL study covering two diffusion models, three RL algorithms, nine reward MLLM backbones from four MLLM families spanning 4B to 235B parameters, and five out-of-distribution text-to-image benchmarks. Results show that both SpectraReward and Self-SpectraReward significantly and consistently improve generation performance and outperform prior MLLM-derived reward training methods. Further analysis reveals that larger reward MLLMs are not always better, while Self-SpectraReward can match or surpass much larger external reward models, suggesting that reward-policy alignment is a key factor for effective image-generation RL. Project Page: https://huangrh99.github.io/SpectraReward/