MIMFlow: Integratie van gemaskerde beeldmodellering met normaliserende stromen voor eind-tot-eind beeldgeneratie
MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation
June 24, 2026
Auteurs: Yang Chen, Xiaowei Xu, Shuai Wang, Xinwen Zhang, Qiushi Guo, Tiezheng Ge, Limin Wang
cs.AI
Samenvatting
Normalizing Flows (NFs) zijn krachtige generatieve modellen die exacte dichtheidsschatting en sampling mogelijk maken. Hun strikte inverteerbaarheid dwingt het model echter vaak om zijn capaciteit uit te putten op laag-niveau pixeldetails, wat het vastleggen van hoog-niveau semantische structuren belemmert. Hoewel Masked Image Modeling (MIM) uitblinkt in representatieleren, is de integratie ervan in generatieve pijplijnen grotendeels modulair en onsamenhangend gebleven. In dit artikel stellen we MIMFlow voor, een uniform end-to-end raamwerk dat latente semantiek, pixelreconstructie en generatieve flow gezamenlijk optimaliseert. Door een VAE-encoder te gebruiken om semantische latenten uit gemaskeerde afbeeldingen af te leiden, bereikt MIMFlow een principiële ontkoppeling van de generatieve taak: de Normalizing Flow richt zich op het modelleren van een vereenvoudigd, laagfrequent semantisch manifold, terwijl een gespecialiseerde decoder de hoogfrequente synthese afhandelt. Dit ontwerp lost effectief de inherente capaciteitsknelpunt van NFs op, waardoor het model prioriteit kan geven aan globale structurele coherentie boven redundante ruis. Empirische resultaten op ImageNet 256×256 tonen aan dat MIMFlow-L een lineaire probing nauwkeurigheid van 71,3% en een FID van 2,50 bereikt. Ondanks het gebruik van slechts 128 tokens (50% minder dan standaardmodellen), levert het een prestatieverbetering van 32,8% op ten opzichte van NF-baselines van vergelijkbare schaal. Onze code is beschikbaar op https://github.com/MCG-NJU/MIMFlow.
English
Normalizing Flows (NFs) are powerful generative models capable of exact density estimation and sampling. However, their strict invertibility often forces the model to exhaust its capacity on low-level pixel details, hindering the capture of high-level semantic structures. While Masked Image Modeling (MIM) has excelled in representation learning, its integration into generative pipelines has remained largely modular and disjointed. In this paper, we propose MIMFlow, a unified end-to-end framework that jointly optimizes latent semantics, pixel reconstruction, and generative flow. By employing a VAE encoder to infer semantic latent from masked images, MIMFlow achieves a principled decoupling of the generative task: the Normalizing Flow focuses on modeling a simplified, low-frequency semantic manifold, while a specialized decoder handles high-frequency synthesis. This design effectively resolves the inherent capacity bottleneck of NFs, allowing the model to prioritize global structural coherence over redundant noise. Empirical results on ImageNet 256times256 show that MIMFlow-L reaches 71.3\% linear probing accuracy and an FID of 2.50. Despite using only 128 tokens (50\% fewer than standard models), it yields a 32.8\% performance gain over similar-scale NF baselines. Our code is available at https://github.com/MCG-NJU/MIMFlow.