MeanFlowNFT: 순방향 과정 강화 학습을 평균 속도 생성기에 도입
MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators
July 16, 2026
저자: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang
cs.AI
초록
MeanFlow 생성기는 시간 간격에 걸친 평균 속도를 예측하여 빠른 소수 단계 샘플링을 가능하게 하므로 효율적인 생성에 매력적이다. 강화 학습(RL)은 확산 및 흐름 모델을 인간의 선호도 및 작업별 목표와 정렬시키는 강력한 방법으로 자리 잡았다. 특히, DiffusionNFT는 역과정 궤적이나 우도 추정이 필요 없는 효율적인 순방향 과정 RL 프레임워크를 제공한다. 그러나 이러한 RL 방법을 MeanFlow에 적용하는 것은 아직 충분히 탐구되지 않았다. DiffusionNFT는 순간 속도를 최적화하는 반면, MeanFlow는 평균 속도로 샘플링한다. 이러한 차이를 해소하기 위해 우리는 MeanFlowNFT를 도입한다. 평균 속도와 순간 속도를 연결하는 MeanFlow 항등식에서 영감을 받아, 유도된 순간 속도 예측기를 구성한다. 이 예측기에 DiffusionNFT 목적 함수를 적용하여 MeanFlow에 대한 보상 최적화를 명확히 정의한다. 샘플링은 평균 속도에 기반하여 MeanFlow의 빠른 소수 단계 생성을 유지한다. 우리는 나아가 MeanFlowNFT가 DiffusionNFT의 엄격한 정책 개선 보장을 계승함을 증명한다. 이미지 및 비디오 생성 실험에서 MeanFlowNFT가 기준선을 일관되게 개선함을 보여준다. 또한, 대부분의 지표에서(SD3.5-M의 8개 중 6개) 이전 최첨단 RL 튜닝 소수 단계 생성기를 능가하며, 소수 샘플링 단계만으로도 다중 단계 RL 튜닝 확산 모델을 능가할 수 있다. 예를 들어, Wan 2.1에서 4단계 MeanFlowNFT는 VBench 점수 84.33에 도달하여 50단계 LongCat-Video RL(82.57)을 능가한다.
English
MeanFlow generators achieve fast few-step sampling by predicting average velocities over time intervals, making them attractive for efficient generation. Reinforcement learning (RL) has become a powerful way to align diffusion and flow models with human preferences and task-specific objectives. In particular, DiffusionNFT offers an efficient forward-process RL framework that does not require reverse-process trajectories or likelihood estimation. However, applying such RL methods to MeanFlow remains underexplored. DiffusionNFT optimizes instantaneous velocities, whereas MeanFlow samples with average velocities. To bridge this gap, we introduce MeanFlowNFT. Inspired by the MeanFlow identity, which bridges average and instantaneous velocities, we construct an induced instantaneous-velocity predictor. We apply the DiffusionNFT objective to this predictor, making reward optimization well-defined for MeanFlow. Sampling remains based on the average velocity, preserving MeanFlow's fast few-step generation. We further prove that MeanFlowNFT inherits DiffusionNFT's strict policy-improvement guarantee. Experiments on image and video generation show that MeanFlowNFT consistently improves baselines. Moreover, it outperforms prior state-of-the-art RL-tuned few-step generators on most metrics (6 of 8 on SD3.5-M), and can even surpass multi-step RL-tuned diffusion while using only a few sampling steps. For instance, on Wan 2.1, 4-step MeanFlowNFT reaches a VBench score of 84.33, surpassing 50-step LongCat-Video RL (82.57).