ChatPaper.aiChatPaper

Multi-Resolution Flow Matching: Trainingsvrije Diffusieversnelling via Gefaseerde Sampling

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

July 2, 2026
Auteurs: Xingyu Zheng, Xianglong Liu, Yifu Ding, Weilun Feng, Junqing Lin, Jinyang Guo, Haotong Qin
cs.AI

Samenvatting

Hardware-agnostische strategieën voor het versnellen van tekst-naar-beeld diffusie, zoals tijdstapdestillatie en feature caching, kunnen de inferentietijd verkorten zonder aangepaste kernels of optimalisatie op systeemniveau. Daaronder hebben multi-resolutie generatiestrategieën recentelijk brede aandacht gekregen, waarmee een versnelling van meer dan 5x wordt behaald zonder enige training. Het ontwerp van het uitvoeren van upsampling in de latente ruimte, samen met de selectieve modificatie van gedeeltelijke regio's, zorgt er echter voor dat deze methoden merkbare vervaging of artefacten vertonen. Daartoe stellen wij MrFlow voor, een trainingsvrije multi-resolutie versnellingsstrategie voor voorgetrainde flow-matching modellen, gebaseerd op een gefaseerde pijplijn van lage naar hoge resolutie. MrFlow genereert eerst snel de hoofdstructuur op lage resolutie, voert vervolgens superresolutie uit in de pixelruimte met behulp van een lichtgewicht voorgetraind GAN-gebaseerd model, injecteert daarna ruis met lage sterkte om hoogfrequente hersampling mogelijk te maken, en verfijnt ten slotte de details op hoge resolutie. Kwantitatieve en kwalitatieve resultaten op FLUX.1-dev en Qwen-Image tonen aan dat MrFlow de kwadratische tokenreductie en verminderde stapvereiste van lage-resolutiesampling benut om een end-to-end versnelling van 10x te bereiken, terwijl OneIG binnen een marge van 1% blijft ten opzichte van vóór de versnelling, waarmee het aanzienlijk beter presteert dan andere trainingsvrije versnellingsstrategieën, en geen enkele training of dynamische identificatie tijdens runtime vereist. MrFlow kan verder direct orthogonaal worden gecombineerd met voorgetrainde tijdstapdestillatiestrategieën, wat een nog hogere generatieversnelling van tot wel 25x oplevert.
English
Hardware-agnostic strategies for accelerating text-to-image diffusion, such as timestep distillation and feature caching, can reduce inference time without custom kernels or system-level optimization. Among them, multi-resolution generation strategies have recently received broad attention, attaining more than 5x speedup without any training. However, the design of performing upsampling in the latent space, together with the selective modification of partial regions, causes these methods to exhibit noticeable blurring or artifacts. To this end, we propose MrFlow, a training-free multi-resolution acceleration strategy for pretrained flow-matching models built upon a staged low-to-high-resolution pipeline. MrFlow first rapidly generates the main structure at low resolution, then performs super-resolution in the pixel space using a lightweight pretrained GAN-based model, subsequently injects low-strength noise to enable high-frequency resampling, and finally refines the details at high resolution. Quantitative and qualitative results on FLUX.1-dev and Qwen-Image show that MrFlow exploits the quadratic token reduction and reduced step requirement of low-resolution sampling to achieve 10x end-to-end acceleration while keeping OneIG within a 1% gap relative to that before acceleration, significantly surpassing other training-free acceleration strategies, and requiring no training or runtime dynamic identification whatsoever. MrFlow can further be directly combined orthogonally with pre-trained timestep distillation strategies, achieving even higher generation acceleration of up to 25x.