Перцептивное согласование потоков для малошагового генеративного моделирования
Perceptual Flow Matching for Few-Step Generative Modeling
July 3, 2026
Авторы: Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan
cs.AI
Аннотация
Мы предлагаем метод перцептивного потокового согласования (Perceptual Flow Matching, PFM) — простую, но эффективную схему для генерации за несколько шагов в моделях потокового согласования. В отличие от традиционной регрессии скорости в скрытом пространстве VAE, PFM осуществляет контроль потокового согласования в перцептивном пространстве признаков с помощью предварительно обученных перцептивных моделей. Это простое изменение значительно улучшает способность моделей потокового согласования к генерации за несколько шагов, сокращая количество шагов семплирования с 35–50 до 4–8 при сохранении качества генерации. В отличие от существующих методов ускорения и дистилляции, PFM не требует ни учительских моделей, ни вспомогательных сетей оценок и может быть интегрирован в стандартные обучающие конвейеры потокового согласования с минимальными модификациями. Обширные эксперименты по генерации изображений, видео и редактированию изображений показывают, что PFM стабильно дает высококачественные результаты, создавая при этом меньше артефактов по сравнению с существующими методами на основе дистилляции. Мы также демонстрируем, что перцептивный контроль смещает минимизатор регрессии от поиска среднего к поиску моды, направляя предсказания к модам на многообразии, которые остаются точными при грубой интеграции за несколько шагов. Наши результаты показывают, что стандартное обучение потокового согласования может естественным образом давать высококачественные генераторы за несколько шагов при контроле в подходящем пространстве представлений. Мы надеемся, что это понимание вдохновит будущие исследования задач, учитывающих представления, для эффективного порождающего моделирования.
English
We propose Perceptual Flow Matching (PFM), a simple yet effective framework for few-step generation in flow-matching models. Rather than performing velocity regression in the conventional VAE latent space, PFM supervises flow matching in a perceptual feature space using pretrained perceptual models. This simple change substantially improves the few-step generation capability of flow-matching models, reducing the number of sampling steps from 35-50 to 4-8 while preserving generation quality. Unlike existing acceleration and distillation approaches, PFM requires neither teacher models nor auxiliary score networks and can be integrated into standard flow-matching training pipelines with minimal modifications. Extensive experiments on image generation, video generation, and image editing tasks demonstrate that PFM consistently produces high-quality results while producing fewer artifacts than existing distillation-based methods. We further show that perceptual supervision shifts the regression minimizer from mean-seeking to mode-seeking, biasing predictions toward on-manifold modes that remain accurate under coarse few-step integration. Our results reveal that standard flow-matching training can naturally yield high-quality few-step generators when supervised in an appropriate representation space. We hope this insight inspires future research into representation-aware objectives for efficient generative modeling.