ChatPaper.aiChatPaper

Appariement de flux perceptuel pour la modélisation générative en quelques étapes

Perceptual Flow Matching for Few-Step Generative Modeling

July 3, 2026
Auteurs: Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan
cs.AI

Résumé

Nous proposons le Perceptual Flow Matching (PFM), un cadre simple mais efficace pour la génération en quelques étapes dans les modèles d’appariement de flux. Plutôt que d’effectuer une régression de vélocité dans l’espace latent conventionnel du VAE, le PFM supervise l’appariement de flux dans un espace de caractéristiques perceptuelles à l’aide de modèles perceptuels pré-entraînés. Ce simple changement améliore considérablement la capacité de génération en quelques étapes des modèles d’appariement de flux, réduisant le nombre d’étapes d’échantillonnage de 35–50 à 4–8 tout en préservant la qualité de génération. Contrairement aux approches existantes d’accélération et de distillation, le PFM ne nécessite ni modèles enseignants ni réseaux de score auxiliaires et peut être intégré dans les pipelines d’entraînement standard d’appariement de flux avec des modifications minimales. Des expériences approfondies sur des tâches de génération d’images, de génération de vidéos et d’édition d’images montrent que le PFM produit systématiquement des résultats de haute qualité tout en générant moins d’artefacts que les méthodes basées sur la distillation. Nous montrons en outre que la supervision perceptuelle déplace le minimiseur de régression de la recherche de la moyenne vers la recherche du mode, orientant les prédictions vers des modes sur la variété qui restent précis sous une intégration grossière en quelques étapes. Nos résultats révèlent que l’entraînement standard d’appariement de flux peut naturellement produire des générateurs de haute qualité en quelques étapes lorsqu’il est supervisé dans un espace de représentation approprié. Nous espérons que cette perspective inspirera de futures recherches sur des objectifs tenant compte de la représentation pour une modélisation générative efficace.
English
We propose Perceptual Flow Matching (PFM), a simple yet effective framework for few-step generation in flow-matching models. Rather than performing velocity regression in the conventional VAE latent space, PFM supervises flow matching in a perceptual feature space using pretrained perceptual models. This simple change substantially improves the few-step generation capability of flow-matching models, reducing the number of sampling steps from 35-50 to 4-8 while preserving generation quality. Unlike existing acceleration and distillation approaches, PFM requires neither teacher models nor auxiliary score networks and can be integrated into standard flow-matching training pipelines with minimal modifications. Extensive experiments on image generation, video generation, and image editing tasks demonstrate that PFM consistently produces high-quality results while producing fewer artifacts than existing distillation-based methods. We further show that perceptual supervision shifts the regression minimizer from mean-seeking to mode-seeking, biasing predictions toward on-manifold modes that remain accurate under coarse few-step integration. Our results reveal that standard flow-matching training can naturally yield high-quality few-step generators when supervised in an appropriate representation space. We hope this insight inspires future research into representation-aware objectives for efficient generative modeling.