ChatPaper.aiChatPaper

L2P: Desbloqueando o Potencial Latente para Geração de Pixels

L2P: Unlocking Latent Potential for Pixel Generation

May 12, 2026
Autores: Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Jiawei Chen, Zhuoqi Zeng, Wei Zhang, Chengjie Wang, Jian Yang, Ying Tai
cs.AI

Resumo

Modelos de difusão de pixel recentemente voltaram a atrair atenção para a geração visual. No entanto, treinar modelos avançados de espaço de pixel do zero exige recursos computacionais e de dados proibitivos. Para lidar com isso, propomos o paradigma de transferência Latente-para-Pixel (L2P), uma estrutura eficiente que aproveita diretamente o rico conhecimento de Modelos de Difusão Latente (LDM) pré-treinados para construir modelos poderosos de espaço de pixel. Especificamente, o L2P descarta o VAE em favor da tokenização de grandes patches e congela as camadas intermediárias do LDM de origem, treinando exclusivamente camadas rasas para aprender a transformação latente-para-pixel. Ao utilizar imagens sintéticas geradas por LDM como o único corpus de treinamento, o L2P ajusta uma variedade de dados já suave, permitindo convergência rápida com coleta zero de dados reais. Essa estratégia permite que o L2P migre perfeitamente grandes prioris latentes para o espaço de pixel usando apenas 8 GPUs. Além disso, a eliminação do gargalo de memória do VAE desbloqueia a geração nativa de ultra-alta resolução 4K. Extensos experimentos em arquiteturas LDM convencionais mostram que o L2P incorre em sobrecarga de treinamento insignificante, mas tem desempenho equivalente ao LDM de origem no DPG-Bench e atinge 93% de desempenho no GenEval.
English
Pixel diffusion models have recently regained attention for visual generation. However, training advanced pixel-space models from scratch demands prohibitive computational and data resources. To address this, we propose the Latent-to-Pixel (L2P) transfer paradigm, an efficient framework that directly harnesses the rich knowledge of pre-trained LDMs to build powerful pixel-space models. Specifically, L2P discards the VAE in favor of large-patch tokenization and freezes the source LDM's intermediate layers, exclusively training shallow layers to learn the latent-to-pixel transformation. By utilizing LDM-generated synthetic images as the sole training corpus, L2P fits an already smooth data manifold, enabling rapid convergence with zero real-data collection. This strategy allows L2P to seamlessly migrate massive latent priors to the pixel space using only 8 GPUs. Furthermore, eliminating the VAE memory bottleneck unlocks native 4K ultra-high resolution generation. Extensive experiments across mainstream LDM architectures show that L2P incurs negligible training overhead, yet performs on par with the source LDM on DPG-Bench and reaches 93% performance on GenEval.