Multirresolução Flow Matching: Aceleração de Difusão sem Treinamento via Amostragem em Etapas
Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
July 2, 2026
Autores: Xingyu Zheng, Xianglong Liu, Yifu Ding, Weilun Feng, Junqing Lin, Jinyang Guo, Haotong Qin
cs.AI
Resumo
Estratégias independentes de hardware para acelerar a difusão texto-imagem, como destilação de passos temporais e cache de características, podem reduzir o tempo de inferência sem kernels personalizados ou otimização em nível de sistema. Entre elas, as estratégias de geração em múltiplas resoluções receberam recentemente ampla atenção, alcançando mais de 5x de aceleração sem qualquer treinamento. No entanto, o design de realizar upsampling no espaço latente, juntamente com a modificação seletiva de regiões parciais, faz com que esses métodos apresentem desfoque ou artefatos perceptíveis. Para este fim, propomos o MrFlow, uma estratégia de aceleração em múltiplas resoluções sem treinamento para modelos de correspondência de fluxo pré-treinados, construída sobre um pipeline em estágios de baixa para alta resolução. O MrFlow primeiro gera rapidamente a estrutura principal em baixa resolução, depois realiza super-resolução no espaço de pixels usando um modelo leve baseado em GAN pré-treinado, subsequentemente injeta ruído de baixa intensidade para permitir reamostragem de alta frequência e, finalmente, refina os detalhes em alta resolução. Resultados quantitativos e qualitativos no FLUX.1-dev e Qwen-Image mostram que o MrFlow explora a redução quadrática de tokens e a redução na exigência de passos da amostragem em baixa resolução para alcançar 10x de aceleração de ponta a ponta, mantendo o OneIG dentro de uma diferença de 1% em relação ao valor antes da aceleração, superando significativamente outras estratégias de aceleração sem treinamento, e não exigindo treinamento ou identificação dinâmica em tempo de execução. O MrFlow pode ainda ser combinado diretamente de forma ortogonal com estratégias pré-treinadas de destilação de passos temporais, alcançando uma aceleração de geração ainda maior de até 25x.
English
Hardware-agnostic strategies for accelerating text-to-image diffusion, such as timestep distillation and feature caching, can reduce inference time without custom kernels or system-level optimization. Among them, multi-resolution generation strategies have recently received broad attention, attaining more than 5x speedup without any training. However, the design of performing upsampling in the latent space, together with the selective modification of partial regions, causes these methods to exhibit noticeable blurring or artifacts. To this end, we propose MrFlow, a training-free multi-resolution acceleration strategy for pretrained flow-matching models built upon a staged low-to-high-resolution pipeline. MrFlow first rapidly generates the main structure at low resolution, then performs super-resolution in the pixel space using a lightweight pretrained GAN-based model, subsequently injects low-strength noise to enable high-frequency resampling, and finally refines the details at high resolution. Quantitative and qualitative results on FLUX.1-dev and Qwen-Image show that MrFlow exploits the quadratic token reduction and reduced step requirement of low-resolution sampling to achieve 10x end-to-end acceleration while keeping OneIG within a 1% gap relative to that before acceleration, significantly surpassing other training-free acceleration strategies, and requiring no training or runtime dynamic identification whatsoever. MrFlow can further be directly combined orthogonally with pre-trained timestep distillation strategies, achieving even higher generation acceleration of up to 25x.