Otimizando Modelos Generativos Visuais via Recompensas Baseadas na Distribuição
Optimizing Visual Generative Models via Distribution-wise Rewards
July 2, 2026
Autores: Ruihang Li, Mengde Xu, Shuyang Gu, Leigang Qu, Fuli Feng, Han Hu, Wenjie Wang
cs.AI
Resumo
Estratégias convencionais de aprendizado por reforço para geração visual tipicamente empregam funções de recompensa baseadas em amostras individuais, contudo essa prática frequentemente resulta em hacking de recompensa que degrada a diversidade das imagens e introduz anomalias visuais. Para superar essas limitações, apresentamos uma nova estrutura que ajusta modelos generativos utilizando recompensas por distribuição, garantindo melhor alinhamento com as distribuições de dados do mundo real. Diferentemente das recompensas que avaliam amostras individualmente, a recompensa por distribuição considera a distribuição dos dados das amostras, mitigando o problema de colapso modal que ocorre quando todas as amostras otimizam independentemente na mesma direção. Para contornar o custo computacional proibitivo da estimação dessas recompensas, introduzimos uma estratégia de substituição de subconjuntos que fornece sinais de recompensa de forma eficiente, atualizando apenas um pequeno subconjunto de um conjunto de referência gerado. Além disso, aplicamos RL para otimizar coeficientes de combinação de modelos post-hoc, potencialmente mitigando a inconsistência entre treino e inferência causada pela introdução de equações diferenciais estocásticas (SDE) em práticas regulares de RL. Experimentos extensivos mostram que nossa abordagem melhora significativamente o FID-50K em vários modelos base, de 8,30 para 5,77 no SiT e de 3,74 para 3,52 no EDM2. A avaliação qualitativa também confirma que nosso método aprimora a qualidade perceptual enquanto preserva a diversidade das amostras.
English
Conventional reinforcement learning strategies for visual generation typically employ sample-wise reward functions, yet this practice frequently results in reward hacking that degrades image diversity and introduces visual anomalies. To address these limitations, we present a novel framework that finetunes generative models using distribution-wise rewards, ensuring better alignment with real-world data distributions. Unlike rewards that evaluate samples individually, distribution-wise reward accounts for the data distribution of the samples, mitigating the mode collapse problem that occurs when all samples optimize towards the same direction independently. To overcome the prohibitive computational cost of estimating these rewards, we introduce a subset-replace strategy that efficiently provides reward signals by updating only a small subset of a generated reference set. Additionally, we apply RL to optimize post-hoc model merging coefficients, potentially mitigating the train-inference inconsistency caused by introducing stochastic differential equation (SDE) in regular RL practices. Extensive experiments show our approach significantly improves FID-50K across various base models, from 8.30 to 5.77 for SiT and from 3.74 to 3.52 for EDM2. Qualitative evaluation also confirms that our method enhances perceptual quality while preserving sample diversity.