ChatPaper.aiChatPaper

MeanFlowNFT: Перенос RL прямого процесса на генераторы средней скорости

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

July 16, 2026
Авторы: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang
cs.AI

Аннотация

Генераторы MeanFlow обеспечивают быструю выборку за несколько шагов, предсказывая средние скорости на временных интервалах, что делает их привлекательными для эффективной генерации. Обучение с подкреплением (RL) стало мощным инструментом для согласования диффузионных моделей и моделей потоков с человеческими предпочтениями и специфическими задачами. В частности, DiffusionNFT предлагает эффективную RL-структуру прямого процесса, не требующую траекторий обратного процесса или оценки правдоподобия. Однако применение таких RL-методов к MeanFlow остается малоизученным. DiffusionNFT оптимизирует мгновенные скорости, тогда как MeanFlow осуществляет выборку со средними скоростями. Чтобы преодолеть этот разрыв, мы представляем MeanFlowNFT. Вдохновляясь тождеством MeanFlow, связывающим средние и мгновенные скорости, мы конструируем индуцированный предиктор мгновенной скорости. Применяя целевую функцию DiffusionNFT к этому предиктору, мы делаем оптимизацию вознаграждения корректно определенной для MeanFlow. Выборка по-прежнему основана на средней скорости, что сохраняет быструю многошаговую генерацию MeanFlow. Мы также доказываем, что MeanFlowNFT наследует гарантию строгого улучшения политики от DiffusionNFT. Эксперименты по генерации изображений и видео показывают, что MeanFlowNFT последовательно улучшает базовые модели. Более того, он превосходит предыдущие современные RL-настроенные генераторы с малым числом шагов по большинству метрик (6 из 8 на SD3.5-M) и может даже превзойти многошаговые RL-настроенные диффузионные модели, используя лишь несколько шагов выборки. Например, на Wan 2.1 4-шаговый MeanFlowNFT достигает оценки VBench 84.33, превосходя 50-шаговый LongCat-Video RL (82.57).
English
MeanFlow generators achieve fast few-step sampling by predicting average velocities over time intervals, making them attractive for efficient generation. Reinforcement learning (RL) has become a powerful way to align diffusion and flow models with human preferences and task-specific objectives. In particular, DiffusionNFT offers an efficient forward-process RL framework that does not require reverse-process trajectories or likelihood estimation. However, applying such RL methods to MeanFlow remains underexplored. DiffusionNFT optimizes instantaneous velocities, whereas MeanFlow samples with average velocities. To bridge this gap, we introduce MeanFlowNFT. Inspired by the MeanFlow identity, which bridges average and instantaneous velocities, we construct an induced instantaneous-velocity predictor. We apply the DiffusionNFT objective to this predictor, making reward optimization well-defined for MeanFlow. Sampling remains based on the average velocity, preserving MeanFlow's fast few-step generation. We further prove that MeanFlowNFT inherits DiffusionNFT's strict policy-improvement guarantee. Experiments on image and video generation show that MeanFlowNFT consistently improves baselines. Moreover, it outperforms prior state-of-the-art RL-tuned few-step generators on most metrics (6 of 8 on SD3.5-M), and can even surpass multi-step RL-tuned diffusion while using only a few sampling steps. For instance, on Wan 2.1, 4-step MeanFlowNFT reaches a VBench score of 84.33, surpassing 50-step LongCat-Video RL (82.57).