Los registros importan para los Transformers de Difusión en el espacio de píxeles
Registers Matter for Pixel-Space Diffusion Transformers
July 6, 2026
Autores: Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk
cs.AI
Resumen
Los Vision Transformers (ViTs) son conocidos por presentar valores atípicos de alta norma en los tokens de parche que degradan la calidad de los mapas de características, un problema mitigado eficazmente mediante el uso de tokens de registro. A medida que los modelos de difusión adoptan cada vez más arquitecturas transformer y avanzan hacia el entrenamiento en el espacio de píxeles, se acercan en forma a los ViTs, lo que plantea la cuestión de si los tokens de registro también son útiles para los Diffusion Transformers (DiTs). En este trabajo, mostramos que los DiTs difieren de los ViTs en un aspecto clave: no presentan valores atípicos en los tokens de parche, pero aun así se benefician de los tokens de registro. Curiosamente, los tokens de registro son más efectivos en los DiTs en el espacio de píxeles que en los DiTs en el espacio latente. Mediante el análisis de representaciones intermedias, encontramos que los tokens de registro producen mapas de características más limpios en niveles de ruido elevados, lo que puede contribuir a su efectividad en la generación en el espacio de píxeles. Observamos además que las arquitecturas recientes de DiTs en el espacio de píxeles incorporan implícitamente mecanismos similares a los tokens de registro, lo que podría explicar en parte su sólido rendimiento empírico. Motivados por estas observaciones, proponemos Register Guidance, una técnica que amplifica la contribución de los tokens de registro responsables de mejorar la estructura visual y la coherencia.
English
Vision Transformers (ViTs) are known to exhibit high-norm patch-token outliers that degrade feature map quality, a problem effectively mitigated by register tokens. As diffusion models increasingly adopt transformer architectures and move toward pixel-space training, they become closer in form to ViTs, raising the question of whether register tokens are also useful for Diffusion Transformers (DiTs). In this work, we show that DiTs differ from ViTs in a key respect: they do not exhibit patch-token outliers but still benefit from registers. Interestingly, registers are more effective in pixel-space DiTs than in latent-space DiTs. By analyzing intermediate representations, we find that register tokens produce cleaner feature maps at high noise levels, which may contribute to their effectiveness in pixel-space generation. We further observe that recent pixel-space DiT architectures implicitly incorporate register-like mechanisms, which may partially account for their strong empirical performance. Motivated by these observations, we propose Register Guidance, a technique that amplifies the contribution of register tokens responsible for improving visual structure and coherence.