Registros Importam para Transformadores de Difusão no Espaço de Pixel
Registers Matter for Pixel-Space Diffusion Transformers
July 6, 2026
Autores: Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk
cs.AI
Resumo
Transformadores de Visão (ViTs) são conhecidos por exibir outliers de tokens de patch de alta norma que degradam a qualidade dos mapas de características, um problema efetivamente mitigado por tokens de registro. À medida que modelos de difusão adotam cada vez mais arquiteturas de transformadores e avançam para treinamento no espaço de pixels, eles se aproximam em forma dos ViTs, levantando a questão de se tokens de registro também são úteis para Transformadores de Difusão (DiTs). Neste trabalho, mostramos que os DiTs diferem dos ViTs em um aspecto fundamental: eles não exibem outliers de tokens de patch, mas ainda se beneficiam de registros. Curiosamente, os tokens de registro são mais eficazes em DiTs no espaço de pixels do que em DiTs no espaço latente. Ao analisar representações intermediárias, descobrimos que os tokens de registro produzem mapas de características mais limpos em níveis altos de ruído, o que pode contribuir para sua eficácia na geração no espaço de pixels. Observamos ainda que arquiteturas recentes de DiTs no espaço de pixels incorporam implicitamente mecanismos semelhantes a registros, o que pode explicar parcialmente seu forte desempenho empírico. Motivados por essas observações, propomos a Orientação de Registro, uma técnica que amplifica a contribuição dos tokens de registro responsáveis por melhorar a estrutura visual e a coerência.
English
Vision Transformers (ViTs) are known to exhibit high-norm patch-token outliers that degrade feature map quality, a problem effectively mitigated by register tokens. As diffusion models increasingly adopt transformer architectures and move toward pixel-space training, they become closer in form to ViTs, raising the question of whether register tokens are also useful for Diffusion Transformers (DiTs). In this work, we show that DiTs differ from ViTs in a key respect: they do not exhibit patch-token outliers but still benefit from registers. Interestingly, registers are more effective in pixel-space DiTs than in latent-space DiTs. By analyzing intermediate representations, we find that register tokens produce cleaner feature maps at high noise levels, which may contribute to their effectiveness in pixel-space generation. We further observe that recent pixel-space DiT architectures implicitly incorporate register-like mechanisms, which may partially account for their strong empirical performance. Motivated by these observations, we propose Register Guidance, a technique that amplifies the contribution of register tokens responsible for improving visual structure and coherence.