ChatPaper.aiChatPaper

Perceptuele Flow Matching voor Generatieve Modellering in Weinig Stappen

Perceptual Flow Matching for Few-Step Generative Modeling

July 3, 2026
Auteurs: Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan
cs.AI

Samenvatting

Wij stellen Perceptual Flow Matching (PFM) voor, een eenvoudig maar effectief raamwerk voor generatie in weinig stappen in flow-matching modellen. In plaats van snelheidsregressie uit te voeren in de conventionele VAE-latente ruimte, superviseert PFM flow matching in een perceptuele kenmerkruimte met behulp van voorgetrainde perceptuele modellen. Deze eenvoudige wijziging verbetert de mogelijkheid tot generatie in weinig stappen van flow-matching modellen aanzienlijk, waarbij het aantal bemonsteringsstappen wordt verminderd van 35-50 tot 4-8, terwijl de generatiekwaliteit behouden blijft. In tegenstelling tot bestaande versnellings- en distillatiebenaderingen vereist PFM geen teacher-modellen of hulpscorenetwerken en kan het met minimale aanpassingen worden geïntegreerd in standaard flow-matching trainingspijplijnen. Uitgebreide experimenten op het gebied van beeldgeneratie, videogeneratie en beeldbewerkingstaken tonen aan dat PFM consistent hoogwaardige resultaten oplevert, terwijl het minder artefacten produceert dan bestaande distillatiegebaseerde methoden. We tonen verder aan dat perceptuele supervisie de regressieminimizer verschuift van mean-seeking naar mode-seeking, waardoor voorspellingen worden gebiast naar on-manifold modi die nauwkeurig blijven onder grove integratie in weinig stappen. Onze resultaten onthullen dat standaard flow-matching training op natuurlijke wijze hoogwaardige generatoren in weinig stappen kan opleveren wanneer gesuperviseerd in een geschikte representatieruimte. We hopen dat dit inzicht toekomstig onderzoek naar representatiebewuste doelstellingen voor efficiënt generatief modelleren inspireert.
English
We propose Perceptual Flow Matching (PFM), a simple yet effective framework for few-step generation in flow-matching models. Rather than performing velocity regression in the conventional VAE latent space, PFM supervises flow matching in a perceptual feature space using pretrained perceptual models. This simple change substantially improves the few-step generation capability of flow-matching models, reducing the number of sampling steps from 35-50 to 4-8 while preserving generation quality. Unlike existing acceleration and distillation approaches, PFM requires neither teacher models nor auxiliary score networks and can be integrated into standard flow-matching training pipelines with minimal modifications. Extensive experiments on image generation, video generation, and image editing tasks demonstrate that PFM consistently produces high-quality results while producing fewer artifacts than existing distillation-based methods. We further show that perceptual supervision shifts the regression minimizer from mean-seeking to mode-seeking, biasing predictions toward on-manifold modes that remain accurate under coarse few-step integration. Our results reveal that standard flow-matching training can naturally yield high-quality few-step generators when supervised in an appropriate representation space. We hope this insight inspires future research into representation-aware objectives for efficient generative modeling.