ChatPaper.aiChatPaper

MIMFlow: Integrando Modelagem de Imagem Mascarada com Fluxos Normalizadores para Geração de Imagens Fim a Fim

MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation

June 24, 2026
Autores: Yang Chen, Xiaowei Xu, Shuai Wang, Xinwen Zhang, Qiushi Guo, Tiezheng Ge, Limin Wang
cs.AI

Resumo

Fluxos Normalizadores (NFs) são modelos generativos poderosos capazes de estimação exata de densidade e amostragem. No entanto, sua rigorosa invertibilidade frequentemente força o modelo a esgotar sua capacidade em detalhes de pixels de baixo nível, dificultando a captura de estruturas semânticas de alto nível. Embora a Modelagem de Imagens Mascaradas (MIM) tenha se destacado na aprendizagem de representações, sua integração em pipelines generativos permaneceu amplamente modular e desconexa. Neste artigo, propomos o MIMFlow, uma estrutura unificada ponta a ponta que otimiza conjuntamente semânticas latentes, reconstrução de pixels e fluxo generativo. Ao empregar um codificador VAE para inferir latentes semânticos a partir de imagens mascaradas, o MIMFlow alcança uma separação fundamentada da tarefa generativa: o Fluxo Normalizador concentra-se em modelar uma variedade semântica simplificada e de baixa frequência, enquanto um decodificador especializado lida com a síntese de alta frequência. Esse design resolve efetivamente o gargalo inerente de capacidade dos NFs, permitindo que o modelo priorize a coerência estrutural global em detrimento do ruído redundante. Resultados empíricos no ImageNet 256×256 mostram que o MIMFlow-L atinge 71,3% de precisão de sondagem linear e um FID de 2,50. Apesar de utilizar apenas 128 tokens (50% a menos que modelos padrão), ele produz um ganho de desempenho de 32,8% em relação a linhas de base de NF de escala similar. Nosso código está disponível em https://github.com/MCG-NJU/MIMFlow.
English
Normalizing Flows (NFs) are powerful generative models capable of exact density estimation and sampling. However, their strict invertibility often forces the model to exhaust its capacity on low-level pixel details, hindering the capture of high-level semantic structures. While Masked Image Modeling (MIM) has excelled in representation learning, its integration into generative pipelines has remained largely modular and disjointed. In this paper, we propose MIMFlow, a unified end-to-end framework that jointly optimizes latent semantics, pixel reconstruction, and generative flow. By employing a VAE encoder to infer semantic latent from masked images, MIMFlow achieves a principled decoupling of the generative task: the Normalizing Flow focuses on modeling a simplified, low-frequency semantic manifold, while a specialized decoder handles high-frequency synthesis. This design effectively resolves the inherent capacity bottleneck of NFs, allowing the model to prioritize global structural coherence over redundant noise. Empirical results on ImageNet 256times256 show that MIMFlow-L reaches 71.3\% linear probing accuracy and an FID of 2.50. Despite using only 128 tokens (50\% fewer than standard models), it yields a 32.8\% performance gain over similar-scale NF baselines. Our code is available at https://github.com/MCG-NJU/MIMFlow.