MeanFlowNFT : Apport du RL par processus direct aux générateurs à vitesse moyenne
MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
July 16, 2026
Auteurs: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang
cs.AI
Résumé
Les générateurs MeanFlow permettent un échantillonnage rapide en quelques étapes en prédisant les vitesses moyennes sur des intervalles de temps, ce qui les rend attractifs pour une génération efficace. L'apprentissage par renforcement (RL) est devenu un moyen puissant d'aligner les modèles de diffusion et de flux sur les préférences humaines et les objectifs spécifiques aux tâches. En particulier, DiffusionNFT propose un cadre RL efficace en processus direct qui ne nécessite ni trajectoires de processus inverse ni estimation de vraisemblance. Cependant, l'application de telles méthodes RL à MeanFlow reste peu explorée. DiffusionNFT optimise les vitesses instantanées, alors que MeanFlow échantillonne avec des vitesses moyennes. Pour combler cet écart, nous introduisons MeanFlowNFT. Inspiré par l'identité MeanFlow, qui relie les vitesses moyennes et instantanées, nous construisons un prédicteur de vitesse instantanée induit. Nous appliquons l'objectif de DiffusionNFT à ce prédicteur, rendant l'optimisation par récompense bien définie pour MeanFlow. L'échantillonnage reste basé sur la vitesse moyenne, préservant la génération rapide en quelques étapes de MeanFlow. Nous prouvons en outre que MeanFlowNFT hérite de la garantie stricte d'amélioration de politique de DiffusionNFT. Des expériences sur la génération d'images et de vidéos montrent que MeanFlowNFT améliore systématiquement les références. De plus, il surpasse les générateurs antérieurs en quelques étapes optimisés par RL sur la plupart des métriques (6 sur 8 pour SD3.5-M), et peut même dépasser une diffusion optimisée par RL en plusieurs étapes tout en n'utilisant que quelques étapes d'échantillonnage. Par exemple, sur Wan 2.1, MeanFlowNFT en 4 étapes atteint un score VBench de 84,33, surpassant LongCat-Video RL en 50 étapes (82,57).
English
MeanFlow generators achieve fast few-step sampling by predicting average velocities over time intervals, making them attractive for efficient generation. Reinforcement learning (RL) has become a powerful way to align diffusion and flow models with human preferences and task-specific objectives. In particular, DiffusionNFT offers an efficient forward-process RL framework that does not require reverse-process trajectories or likelihood estimation. However, applying such RL methods to MeanFlow remains underexplored. DiffusionNFT optimizes instantaneous velocities, whereas MeanFlow samples with average velocities. To bridge this gap, we introduce MeanFlowNFT. Inspired by the MeanFlow identity, which bridges average and instantaneous velocities, we construct an induced instantaneous-velocity predictor. We apply the DiffusionNFT objective to this predictor, making reward optimization well-defined for MeanFlow. Sampling remains based on the average velocity, preserving MeanFlow's fast few-step generation. We further prove that MeanFlowNFT inherits DiffusionNFT's strict policy-improvement guarantee. Experiments on image and video generation show that MeanFlowNFT consistently improves baselines. Moreover, it outperforms prior state-of-the-art RL-tuned few-step generators on most metrics (6 of 8 on SD3.5-M), and can even surpass multi-step RL-tuned diffusion while using only a few sampling steps. For instance, on Wan 2.1, 4-step MeanFlowNFT reaches a VBench score of 84.33, surpassing 50-step LongCat-Video RL (82.57).