O que importa para um manifold latente amigável à difusão? Autoencoders alinhados ao prior para difusão latente
What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion
May 8, 2026
Autores: Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Yali Wang
cs.AI
Resumo
Tokenizadores são um componente crucial dos modelos de difusão latente, pois definem o espaço latente no qual os modelos de difusão operam. No entanto, os tokenizadores existentes são projetados principalmente para melhorar a fidelidade de reconstrução ou herdar representações pré-treinadas, deixando incerto que tipo de espaço latente é verdadeiramente favorável para a modelagem generativa. Neste artigo, estudamos essa questão sob a perspectiva da organização da variedade latente. Ao construir variantes controladas de tokenizadores, identificamos três propriedades-chave de uma variedade latente amigável à difusão: estrutura espacial coerente, continuidade local da variedade e semântica global da variedade. Constatamos que essas propriedades são mais consistentes com a qualidade da geração a jusante do que com a fidelidade de reconstrução. Motivados por essa descoberta, propomos o Autoencoder Alinhado por Prior (PAE), que molda explicitamente a variedade latente, em vez de deixar que uma variedade amigável à difusão surja indiretamente da reconstrução ou herança. Especificamente, o PAE aproveita priores refinados derivados de modelos de fundamentos visuais (VFM) e regularização baseada em perturbações para transformar estrutura espacial, continuidade local e semântica global em objetivos explícitos de treinamento. No ImageNet 256x256, o PAE melhora tanto a eficiência do treinamento quanto a qualidade da geração em comparação com tokenizadores existentes, alcançando desempenho comparável ao RAE com convergência até 13x mais rápida sob a mesma configuração de treinamento e obtendo um novo gFID estado da arte de 1,03. Esses resultados destacam a importância de organizar a variedade latente para modelos de difusão latente.
English
Tokenizers are a crucial component of latent diffusion models, as they define the latent space in which diffusion models operate. However, existing tokenizers are primarily designed to improve reconstruction fidelity or inherit pretrained representations, leaving unclear what kind of latent space is truly friendly for generative modeling. In this paper, we study this question from the perspective of latent manifold organization. By constructing controlled tokenizer variants, we identify three key properties of a diffusion-friendly latent manifold: coherent spatial structure, local manifold continuity, and global manifold semantics. We find that these properties are more consistent with downstream generation quality than reconstruction fidelity. Motivated by this finding, we propose the Prior-Aligned AutoEncoder (PAE), which explicitly shapes the latent manifold instead of leaving diffusion-friendly manifold to emerge indirectly from reconstruction or inheritance. Specifically, PAE leverages refined priors derived from VFMs and perturbation-based regularization to turn spatial structure, local continuity, and global semantics into explicit training objectives. On ImageNet 256x256, PAE improves both training efficiency and generation quality over existing tokenizers, reaching performance comparable to RAE with up to 13x faster convergence under the same training setup and achieving a new state-of-the-art gFID of 1.03. These results highlight the importance of organizing the latent manifold for latent diffusion models.