Прочитай это обратно: предварительно обученные MLLM — модели вознаграждения с нулевым обучением для генерации изображений по тексту

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

July 13, 2026
Авторы: Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao
cs.AI

Аннотация

В данной работе мы предлагаем SpectraReward — функцию вознаграждения без дополнительного обучения, которая превращает предварительно обученные MLLM в готовые модели вознаграждения для обучения с подкреплением при генерации изображений. В отличие от подхода, требующего от MLLM оценки сгенерированного изображения или ответа на разбитые проверочные вопросы, SpectraReward измеряет, насколько хорошо исходная подсказка может быть восстановлена из сгенерированного изображения с помощью одного прямого прохода с обусловливанием изображением и принудительным обучением. В качестве вознаграждения мы используем среднее логарифмическое правдоподобие подсказки при условии изображения, напрямую применяя предварительно обученную способность MLLM к согласованию изображения и текста без использования меток предпочтений или дообучения модели вознаграждения. Кроме того, мы вводим Self-SpectraReward — частный случай для унифицированных мультимодальных моделей, в котором собственный модуль понимания политики служит моделью вознаграждения для её модуля генерации, образуя замкнутую структуру самоулучшения без внешних моделей вознаграждения или внешних знаний. Обширные эксперименты подтверждают эффективность SpectraReward в широком исследовании обучения с подкреплением при генерации изображений, охватывающем две диффузионные модели, три алгоритма обучения с подкреплением, девять архитектур MLLM-вознаграждений из четырёх семейств MLLM с числом параметров от 4B до 235B, а также пять тестов генерации текста в изображение, не входящих в распределение. Результаты показывают, что как SpectraReward, так и Self-SpectraReward значительно и стабильно улучшают качество генерации и превосходят предыдущие методы обучения с вознаграждением на основе MLLM. Дальнейший анализ показывает, что более крупные MLLM-вознаграждения не всегда лучше, в то время как Self-SpectraReward может сравниться с гораздо более крупными внешними моделями вознаграждения или превзойти их, что указывает на согласование вознаграждения и политики как ключевой фактор эффективного обучения с подкреплением при генерации изображений. Страница проекта: https://huangrh99.github.io/SpectraReward/
English
In this paper, we propose SpectraReward, a training-free reward function that turns pretrained MLLMs into off-the-shelf reward models for image-generation reinforcement learning. Instead of asking the MLLM to judge a generated image or answer decomposed verification questions, SpectraReward measures how well the original prompt can be recovered from the generated image through a single image-conditioned, teacher-forced forward pass. We use the average image-conditioned prompt log-likelihood as the reward, directly reusing the MLLM's pretrained image-text alignment ability without preference labels, reward-model fine-tuning. We further introduce Self-SpectraReward, a special case for unified multimodal models where the policy's own understanding branch serves as the reward model for its generation branch, forming a closed-loop self-improving framework without external reward models or external knowledge. Extensive experiments validate SpectraReward through a broad image-generation RL study covering two diffusion models, three RL algorithms, nine reward MLLM backbones from four MLLM families spanning 4B to 235B parameters, and five out-of-distribution text-to-image benchmarks. Results show that both SpectraReward and Self-SpectraReward significantly and consistently improve generation performance and outperform prior MLLM-derived reward training methods. Further analysis reveals that larger reward MLLMs are not always better, while Self-SpectraReward can match or surpass much larger external reward models, suggesting that reward-policy alignment is a key factor for effective image-generation RL. Project Page: https://huangrh99.github.io/SpectraReward/
PDF422July 16, 2026