ChatPaper.aiChatPaper

Lees Het Terug: Voorgetrainde MLLM's Zijn Zero-Shot Beloningsmodellen voor Tekst-naar-Afbeelding Generatie

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

July 13, 2026
Auteurs: Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao
cs.AI

Samenvatting

In dit artikel stellen we SpectraReward voor, een trainingsvrije beloningsfunctie die voorgetrainde multimodale grote taalmodellen (MLLMs) omzet in kant-en-klare beloningsmodellen voor versterkend leren in beeldgeneratie. In plaats van het MLLM te vragen een gegenereerde afbeelding te beoordelen of opgesplitste verificatievragen te beantwoorden, meet SpectraReward hoe goed de oorspronkelijke prompt kan worden teruggewonnen uit de gegenereerde afbeelding via een enkele beeldgeconditioneerde, docentgestuurde voorwaartse doorgang. We gebruiken de gemiddelde beeldgeconditioneerde prompt log-waarschijnlijkheid als beloning, waarbij we direct het voorgetrainde beeld-tekst-afstemmingsvermogen van het MLLM hergebruiken zonder voorkeurslabels of fijnafstelling van het beloningsmodel. We introduceren verder Self-SpectraReward, een speciaal geval voor uniforme multimodale modellen waarbij de eigen begripstak van het beleid fungeert als het beloningsmodel voor zijn generatietak, wat een gesloten-lus zelfverbeteringskader vormt zonder externe beloningsmodellen of externe kennis. Uitgebreide experimenten valideren SpectraReward door middel van een brede RL-studie voor beeldgeneratie, die twee diffusiemodellen, drie RL-algoritmen, negen belonings-MLLM-backbones uit vier MLLM-families met parameters van 4B tot 235B, en vijf buiten-de-verdeling tekst-naar-beeld-benchmarks omvat. Resultaten tonen aan dat zowel SpectraReward als Self-SpectraReward de generatieprestaties significant en consistent verbeteren en beter presteren dan eerdere van MLLM afgeleide beloningstrainingsmethoden. Verdere analyse onthult dat grotere belonings-MLLMs niet altijd beter zijn, terwijl Self-SpectraReward veel grotere externe beloningsmodellen kan evenaren of overtreffen, wat suggereert dat belonings-beleid-afstemming een sleutelfactor is voor effectief versterkend leren in beeldgeneratie. Projectpagina: https://huangrh99.github.io/SpectraReward/
English
In this paper, we propose SpectraReward, a training-free reward function that turns pretrained MLLMs into off-the-shelf reward models for image-generation reinforcement learning. Instead of asking the MLLM to judge a generated image or answer decomposed verification questions, SpectraReward measures how well the original prompt can be recovered from the generated image through a single image-conditioned, teacher-forced forward pass. We use the average image-conditioned prompt log-likelihood as the reward, directly reusing the MLLM's pretrained image-text alignment ability without preference labels, reward-model fine-tuning. We further introduce Self-SpectraReward, a special case for unified multimodal models where the policy's own understanding branch serves as the reward model for its generation branch, forming a closed-loop self-improving framework without external reward models or external knowledge. Extensive experiments validate SpectraReward through a broad image-generation RL study covering two diffusion models, three RL algorithms, nine reward MLLM backbones from four MLLM families spanning 4B to 235B parameters, and five out-of-distribution text-to-image benchmarks. Results show that both SpectraReward and Self-SpectraReward significantly and consistently improve generation performance and outperform prior MLLM-derived reward training methods. Further analysis reveals that larger reward MLLMs are not always better, while Self-SpectraReward can match or surpass much larger external reward models, suggesting that reward-policy alignment is a key factor for effective image-generation RL. Project Page: https://huangrh99.github.io/SpectraReward/