ChatPaper.aiChatPaper

Optimaliseren van visuele generatieve modellen via distributiegewijze beloningen

Optimizing Visual Generative Models via Distribution-wise Rewards

July 2, 2026
Auteurs: Ruihang Li, Mengde Xu, Shuyang Gu, Leigang Qu, Fuli Feng, Han Hu, Wenjie Wang
cs.AI

Samenvatting

Conventionele reinforcement learning-strategieën voor visuele generatie maken doorgaans gebruik van steekproefsgewijze beloningsfuncties, maar deze praktijk leidt vaak tot beloninghacking die de diversiteit van afbeeldingen aantast en visuele anomalieën introduceert. Om deze beperkingen aan te pakken, presenteren wij een nieuw raamwerk dat generatieve modellen fine-tunet met behulp van distributiegewijze beloningen, wat zorgt voor een betere aansluiting bij werkelijke dataverdelingen. In tegenstelling tot beloningen die steekproeven individueel evalueren, houdt een distributiegewijze beloning rekening met de dataverdeling van de steekproeven, waardoor het mode collapse-probleem wordt beperkt dat optreedt wanneer alle steekproeven onafhankelijk naar dezelfde richting optimaliseren. Om de buitensporige rekenkosten van het schatten van deze beloningen te overwinnen, introduceren wij een subset-vervangingsstrategie die efficiënt beloningssignalen levert door slechts een kleine subset van een gegenereerde referentieset bij te werken. Daarnaast passen wij RL toe om post-hoc modelfusiecoëfficiënten te optimaliseren, wat mogelijk de trainings-inferentie-inconsistentie vermindert die wordt veroorzaakt door de introductie van stochastische differentiaalvergelijkingen (SDV) in reguliere RL-praktijken. Uitgebreide experimenten tonen aan dat onze aanpak de FID-50K significant verbetert bij diverse basismodellen, van 8,30 naar 5,77 voor SiT en van 3,74 naar 3,52 voor EDM2. Kwalitatieve evaluatie bevestigt ook dat onze methode de perceptuele kwaliteit verbetert terwijl de steekproefdiversiteit behouden blijft.
English
Conventional reinforcement learning strategies for visual generation typically employ sample-wise reward functions, yet this practice frequently results in reward hacking that degrades image diversity and introduces visual anomalies. To address these limitations, we present a novel framework that finetunes generative models using distribution-wise rewards, ensuring better alignment with real-world data distributions. Unlike rewards that evaluate samples individually, distribution-wise reward accounts for the data distribution of the samples, mitigating the mode collapse problem that occurs when all samples optimize towards the same direction independently. To overcome the prohibitive computational cost of estimating these rewards, we introduce a subset-replace strategy that efficiently provides reward signals by updating only a small subset of a generated reference set. Additionally, we apply RL to optimize post-hoc model merging coefficients, potentially mitigating the train-inference inconsistency caused by introducing stochastic differential equation (SDE) in regular RL practices. Extensive experiments show our approach significantly improves FID-50K across various base models, from 8.30 to 5.77 for SiT and from 3.74 to 3.52 for EDM2. Qualitative evaluation also confirms that our method enhances perceptual quality while preserving sample diversity.