Les registres sont importants pour les Transformers de diffusion dans l'espace pixel.
Registers Matter for Pixel-Space Diffusion Transformers
July 6, 2026
Auteurs: Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk
cs.AI
Résumé
Les Vision Transformers (ViTs) sont connus pour présenter des valeurs aberrantes dans les jetons de patch de haute norme, ce qui dégrade la qualité des cartes de caractéristiques, un problème efficacement atténué par les jetons de registre. Alors que les modèles de diffusion adoptent de plus en plus des architectures de transformeurs et s’orientent vers un entraînement dans l’espace des pixels, ils se rapprochent des ViTs dans leur forme, ce qui soulève la question de savoir si les jetons de registre sont également utiles pour les Diffusion Transformers (DiTs). Dans ce travail, nous montrons que les DiTs diffèrent des ViTs sur un point clé : ils ne présentent pas de valeurs aberrantes dans les jetons de patch, mais bénéficient néanmoins des registres. Fait intéressant, les registres sont plus efficaces dans les DiTs opérant dans l’espace des pixels que dans ceux opérant dans l’espace latent. En analysant les représentations intermédiaires, nous constatons que les jetons de registre produisent des cartes de caractéristiques plus propres à des niveaux de bruit élevés, ce qui peut contribuer à leur efficacité dans la génération dans l’espace des pixels. Nous observons en outre que les architectures récentes de DiTs dans l’espace des pixels intègrent implicitement des mécanismes similaires aux registres, ce qui pourrait expliquer en partie leurs performances empiriques élevées. Motivés par ces observations, nous proposons le *Register Guidance*, une technique qui amplifie la contribution des jetons de registre responsables de l’amélioration de la structure visuelle et de la cohérence.
English
Vision Transformers (ViTs) are known to exhibit high-norm patch-token outliers that degrade feature map quality, a problem effectively mitigated by register tokens. As diffusion models increasingly adopt transformer architectures and move toward pixel-space training, they become closer in form to ViTs, raising the question of whether register tokens are also useful for Diffusion Transformers (DiTs). In this work, we show that DiTs differ from ViTs in a key respect: they do not exhibit patch-token outliers but still benefit from registers. Interestingly, registers are more effective in pixel-space DiTs than in latent-space DiTs. By analyzing intermediate representations, we find that register tokens produce cleaner feature maps at high noise levels, which may contribute to their effectiveness in pixel-space generation. We further observe that recent pixel-space DiT architectures implicitly incorporate register-like mechanisms, which may partially account for their strong empirical performance. Motivated by these observations, we propose Register Guidance, a technique that amplifies the contribution of register tokens responsible for improving visual structure and coherence.