MeanFlowNFT: Het Toepassen van Forward-Process RL op Gemiddelde-Snelheidsgeneratoren
MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
July 16, 2026
Auteurs: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang
cs.AI
Samenvatting
MeanFlow-generatoren bereiken snelle bemonstering in enkele stappen door gemiddelde snelheden over tijdsintervallen te voorspellen, wat ze aantrekkelijk maakt voor efficiënte generatie. Reinforcement learning (RL) is uitgegroeid tot een krachtige manier om diffusie- en stroommodellen af te stemmen op menselijke voorkeuren en taakspecifieke doelstellingen. In het bijzonder biedt DiffusionNFT een efficiënt RL-framework voor forward-processen dat geen omgekeerde procestrajecten of waarschijnlijkheidsschattingen vereist. Toepassing van dergelijke RL-methoden op MeanFlow is echter nog niet voldoende onderzocht. DiffusionNFT optimaliseert momentane snelheden, terwijl MeanFlow met gemiddelde snelheden bemonstert. Om deze kloof te overbruggen introduceren we MeanFlowNFT. Geïnspireerd door de MeanFlow-identiteit, die de brug slaat tussen gemiddelde en momentane snelheden, construeren we een geïnduceerde voorspeller van momentane snelheden. We passen de DiffusionNFT-doelstelling toe op deze voorspeller, waardoor beloningsoptimalisatie goed gedefinieerd wordt voor MeanFlow. De bemonstering blijft gebaseerd op de gemiddelde snelheid, waardoor de snelle generatie in enkele stappen van MeanFlow behouden blijft. Verder bewijzen we dat MeanFlowNFT de strikte beleidsverbeteringsgarantie van DiffusionNFT erft. Experimenten op beeld- en videogeneratie tonen aan dat MeanFlowNFT consistent basislijnen verbetert. Bovendien presteert het beter dan eerdere state-of-the-art RL-afgestemde generatoren in enkele stappen op de meeste metrieken (6 van de 8 op SD3.5-M), en het kan zelfs meerstaps RL-afgestemde diffusie overtreffen terwijl het slechts enkele bemonsteringsstappen gebruikt. Bijvoorbeeld, op Wan 2.1 bereikt 4-staps MeanFlowNFT een VBench-score van 84,33, waarmee het 50-staps LongCat-Video RL (82,57) overtreft.
English
MeanFlow generators achieve fast few-step sampling by predicting average velocities over time intervals, making them attractive for efficient generation. Reinforcement learning (RL) has become a powerful way to align diffusion and flow models with human preferences and task-specific objectives. In particular, DiffusionNFT offers an efficient forward-process RL framework that does not require reverse-process trajectories or likelihood estimation. However, applying such RL methods to MeanFlow remains underexplored. DiffusionNFT optimizes instantaneous velocities, whereas MeanFlow samples with average velocities. To bridge this gap, we introduce MeanFlowNFT. Inspired by the MeanFlow identity, which bridges average and instantaneous velocities, we construct an induced instantaneous-velocity predictor. We apply the DiffusionNFT objective to this predictor, making reward optimization well-defined for MeanFlow. Sampling remains based on the average velocity, preserving MeanFlow's fast few-step generation. We further prove that MeanFlowNFT inherits DiffusionNFT's strict policy-improvement guarantee. Experiments on image and video generation show that MeanFlowNFT consistently improves baselines. Moreover, it outperforms prior state-of-the-art RL-tuned few-step generators on most metrics (6 of 8 on SD3.5-M), and can even surpass multi-step RL-tuned diffusion while using only a few sampling steps. For instance, on Wan 2.1, 4-step MeanFlowNFT reaches a VBench score of 84.33, surpassing 50-step LongCat-Video RL (82.57).