NormGuard: Beloning-behoudende Normbeperkingen in Flow-Matching Reinforcement Learning
NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning
June 26, 2026
Auteurs: Tianlin Pan, Lianyu Pang, Cheng Da, Huan Yang, Changqian Yu, Kun Gai, Wenhan Luo
cs.AI
Samenvatting
Reinforcement learning (RL) post-training verbetert de beloningsafstemming van stroomgebaseerde generatoren, maar leidt vaak tot een verslechtering van de perceptuele kwaliteit op manieren die niet worden gedetecteerd door de beloningsproxysignaal. We identificeren een eenvoudig structureel kenmerk van deze drift: bij drie post-trainingmethoden (NFT, AWM, DPO) verhoogt RL-fijnafstemming de stapsgewijze snelheidsnorm |v_θ| met 5% tot 15% ten opzichte van de referentie. Een vorm van norminflatie is bestudeerd in classificatorvrije sturing (CFG), waarbij het terugschalen van de snelheid naar een referentienorm tijdens inferentie de resulterende artefacten kan beperken. Deze correctie tijdens inferentie is echter niet direct overdraagbaar naar RL: het terugschalen van v_θ naar |v_ref| tijdens inferentie verbetert noch de beloning, noch herstelt het de kwaliteitsvermindering, omdat de inflatie is geco-adaptieerd in de modelgewichten. Bovendien toont een adjointgevoeligheidsanalyse aan dat het herschalen van de snelheidsgrootte geen coherent first-order beloningssignaal op batchniveau oplevert, wat erop wijst dat het onderdrukken van norminflatie waarschijnlijk geen consistent beloningsdragende component verwijdert. Aangezien hernormalisatie tijdens inferentie faalt en normonderdrukking geen beloningskosten met zich meebrengt, is interventie tijdens training de juiste strategie. Samen leiden deze bevindingen tot \methodname, een scharnierstraf die alleen actief wordt wanneer |v_θ| |v_ref| overschrijdt en additief samenwerkt met elk snelheidslokaal basisverlies. Bij twee basismodellen, drie post-trainingmethoden en twee beloningsproxysignalen verbetert \methodname consistent de door MLLM beoordeelde beeldkwaliteit en forensisch realisme, terwijl de beloning behouden blijft, met voordelen die versterkt worden bij inferentie met weinig stappen en niet worden verklaard door vroegtijdig stoppen.
English
Reinforcement learning (RL) post-training improves the reward alignment of flow-based generators, but often degrades perceptual quality in ways that are not captured by the reward proxy. We identify a simple structural signature of this drift: across three post-training methods (NFT, AWM, DPO), RL fine-tuning inflates the per-step velocity norm |v_θ| by 5% to 15% relative to the reference. A form of norm inflation has been studied in classifier-free guidance (CFG), where rescaling the velocity back to a reference norm at inference time can mitigate the resulting artifacts. However, this inference-time correction does not transfer cleanly to RL: rescaling v_θ to match |v_{ref}| at inference time neither improves reward nor fixes the quality degradation, because the inflation is co-adapted into the model weights. Furthermore, an adjoint sensitivity analysis shows that velocity magnitude rescaling carries no coherent first-order reward signal at the batch level, indicating that suppressing norm inflation is unlikely to remove a consistently reward-carrying component. Since inference-time renormalization fails while norm suppression carries no reward cost, training-time intervention is the appropriate strategy. Together, these findings motivate \methodname, a hinge penalty that activates only when |v_θ| exceeds |v_{ref}| and composes additively with any velocity-local base loss. Across two base models, three post-training methods, and two reward proxies, \methodname consistently improves MLLM-judged image quality and forensic realism while preserving reward, with gains that amplify under few-step inference and are not explained by early stopping.