Registers Zijn van Belang voor Pixelruimte-Diffusietransformers
Registers Matter for Pixel-Space Diffusion Transformers
July 6, 2026
Auteurs: Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk
cs.AI
Samenvatting
Vision Transformers (ViT's) staan erom bekend dat ze patch-token uitschieters met hoge norm vertonen, die de kwaliteit van feature maps aantasten; een probleem dat effectief wordt verholpen door register tokens. Nu diffusiemodellen steeds vaker transformerarchitecturen overnemen en zich richten op training in de pixelruimte, komen ze qua vorm steeds dichter bij ViT's te staan, wat de vraag oproept of register tokens ook nuttig zijn voor Diffusion Transformers (DiT's). In dit werk tonen we aan dat DiT's op een belangrijk punt verschillen van ViT's: ze vertonen geen patch-token uitschieters, maar hebben toch baat bij registers. Interessant is dat registers effectiever zijn in pixelruimte-DiT's dan in latente-ruimte-DiT's. Door tussentijdse representaties te analyseren, ontdekken we dat register tokens schonere feature maps opleveren bij hoge ruisniveaus, wat kan bijdragen aan hun effectiviteit bij generatie in de pixelruimte. Verder zien we dat recente pixelruimte-DiT-architecturen impliciet registerachtige mechanismen bevatten, wat mogelijk deels hun sterke empirische prestaties verklaart. Gemotiveerd door deze observaties stellen we Register Guidance voor, een techniek die de bijdrage van register tokens versterkt, verantwoordelijk voor het verbeteren van visuele structuur en samenhang.
English
Vision Transformers (ViTs) are known to exhibit high-norm patch-token outliers that degrade feature map quality, a problem effectively mitigated by register tokens. As diffusion models increasingly adopt transformer architectures and move toward pixel-space training, they become closer in form to ViTs, raising the question of whether register tokens are also useful for Diffusion Transformers (DiTs). In this work, we show that DiTs differ from ViTs in a key respect: they do not exhibit patch-token outliers but still benefit from registers. Interestingly, registers are more effective in pixel-space DiTs than in latent-space DiTs. By analyzing intermediate representations, we find that register tokens produce cleaner feature maps at high noise levels, which may contribute to their effectiveness in pixel-space generation. We further observe that recent pixel-space DiT architectures implicitly incorporate register-like mechanisms, which may partially account for their strong empirical performance. Motivated by these observations, we propose Register Guidance, a technique that amplifies the contribution of register tokens responsible for improving visual structure and coherence.