ChatPaper.aiChatPaper

MeanFlowNFT: Aplicando RL de proceso directo a generadores de velocidad promedio

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

July 16, 2026
Autores: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang
cs.AI

Resumen

Los generadores MeanFlow logran un muestreo rápido de pocos pasos al predecir velocidades promedio en intervalos de tiempo, lo que los hace atractivos para una generación eficiente. El aprendizaje por refuerzo (RL) se ha convertido en una herramienta poderosa para alinear los modelos de difusión y flujo con las preferencias humanas y objetivos específicos de la tarea. En particular, DiffusionNFT ofrece un marco de RL eficiente basado en procesos hacia adelante que no requiere trayectorias de proceso inverso ni estimación de verosimilitud. Sin embargo, la aplicación de tales métodos de RL a MeanFlow sigue siendo poco explorada. DiffusionNFT optimiza velocidades instantáneas, mientras que MeanFlow muestrea con velocidades promedio. Para salvar esta brecha, presentamos MeanFlowNFT. Inspirados en la identidad de MeanFlow, que vincula las velocidades promedio e instantáneas, construimos un predictor de velocidad instantánea inducido. Aplicamos el objetivo de DiffusionNFT a este predictor, haciendo que la optimización de la recompensa esté bien definida para MeanFlow. El muestreo sigue basándose en la velocidad promedio, preservando la generación rápida de pocos pasos de MeanFlow. Además, demostramos que MeanFlowNFT hereda la garantía estricta de mejora de política de DiffusionNFT. Experimentos en generación de imágenes y video muestran que MeanFlowNFT mejora consistentemente las líneas base. Además, supera a los generadores de pocos pasos ajustados con RL del estado del arte en la mayoría de las métricas (6 de 8 en SD3.5-M), e incluso puede superar a la difusión ajustada con RL de múltiples pasos usando solo unos pocos pasos de muestreo. Por ejemplo, en Wan 2.1, MeanFlowNFT con 4 pasos alcanza una puntuación VBench de 84.33, superando a LongCat-Video RL de 50 pasos (82.57).
English
MeanFlow generators achieve fast few-step sampling by predicting average velocities over time intervals, making them attractive for efficient generation. Reinforcement learning (RL) has become a powerful way to align diffusion and flow models with human preferences and task-specific objectives. In particular, DiffusionNFT offers an efficient forward-process RL framework that does not require reverse-process trajectories or likelihood estimation. However, applying such RL methods to MeanFlow remains underexplored. DiffusionNFT optimizes instantaneous velocities, whereas MeanFlow samples with average velocities. To bridge this gap, we introduce MeanFlowNFT. Inspired by the MeanFlow identity, which bridges average and instantaneous velocities, we construct an induced instantaneous-velocity predictor. We apply the DiffusionNFT objective to this predictor, making reward optimization well-defined for MeanFlow. Sampling remains based on the average velocity, preserving MeanFlow's fast few-step generation. We further prove that MeanFlowNFT inherits DiffusionNFT's strict policy-improvement guarantee. Experiments on image and video generation show that MeanFlowNFT consistently improves baselines. Moreover, it outperforms prior state-of-the-art RL-tuned few-step generators on most metrics (6 of 8 on SD3.5-M), and can even surpass multi-step RL-tuned diffusion while using only a few sampling steps. For instance, on Wan 2.1, 4-step MeanFlowNFT reaches a VBench score of 84.33, surpassing 50-step LongCat-Video RL (82.57).