Moebius: Framework Leve de Inpainting de Imagens de 0,2B com Desempenho de Nível 10B
Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
June 17, 2026
Autores: Kangsheng Duan, Ziyang Xu, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang
cs.AI
Resumo
Embora modelos de base industrial de nível 10B tenham ampliado os limites do preenchimento de imagens, seus custos computacionais proibitivos dificultam severamente a implantação prática. Construir um especialista altamente otimizado para tarefas específicas oferece uma solução promissora; no entanto, a compressão estrutural extrema desencadeia inevitavelmente um severo gargalo de representação. Para superar isso, propomos o Moebius, um framework leve e altamente eficiente de preenchimento de imagens. Reconstruímos sistematicamente a espinha dorsal de difusão introduzindo o bloco de Interação Mista Local-λ (LλMI). Composto pelos módulos Local-λ e Interativo-λ, ele resume elegantemente contextos espaciais e priores semânticos globais em matrizes lineares de tamanho fixo, preservando interações latentes complexas enquanto reduz drasticamente os parâmetros. Além disso, para desbloquear toda a capacidade representacional desta arquitetura altamente compacta, nós a combinamos sinergicamente com uma estratégia adaptativa de destilação multi-granularidade. Operando estritamente dentro do espaço latente para evitar a cara decodificação no espaço de pixels, essa estratégia equilibra dinamicamente múltiplas perdas baseadas em gradiente para alcançar alinhamento de alta fidelidade. Extensos experimentos em benchmarks naturais e de retratos demonstram que essa sinergia ótima permite que o Moebius rivalize ou até supere a qualidade de geração do generalista industrial de nível 10B FLUX.1-Fill-Dev. Notavelmente, o Moebius consegue isso usando menos de 2% dos parâmetros (0,22B vs. 11,9B) enquanto oferece uma aceleração de mais de 15 vezes no tempo total de inferência, estabelecendo um novo padrão de eficiência para preenchimento de alta fidelidade. Página do projeto em https://hustvl.github.io/Moebius.
English
While 10B-level industrial foundation models have pushed the boundaries of image inpainting, their prohibitive computational costs severely hinder practical deployment. Constructing a highly optimized task-specific specialist offers a promising solution; however, extreme structural compression inevitably triggers a severe representation bottleneck. To conquer this, we propose Moebius, a highly efficient lightweight inpainting framework. We systematically reconstruct the diffusion backbone by introducing the Local-λ Mix Interaction (LλMI) block. Comprising Local-λ and Interactive-λ modules, it elegantly summarizes spatial contexts and global semantic priors into fixed-size linear matrices, preserving complex latent interactions while drastically shedding parameters. Furthermore, to unlock the full representational capacity of this highly compact architecture, we synergistically pair it with an adaptive multi-granularity distillation strategy. Operating strictly within the latent space to avoid expensive pixel-space decoding, this strategy dynamically balances multiple gradient-based losses to achieve high-fidelity alignment. Extensive experiments across natural and portrait benchmarks demonstrate that this optimal synergy enables Moebius to rival or even surpass the generation quality of the 10B-level industrial generalist FLUX.1-Fill-Dev. Remarkably, Moebius achieves this using less than 2\% of the parameters (0.22B vs. 11.9B) while delivering a >15times acceleration in total inference time, setting a new efficiency standard for high-fidelity inpainting. Project page at https://hustvl.github.io/Moebius.