ChatPaper.aiChatPaper

Register sind von Bedeutung für Diffusion-Transformer im Pixelraum

Registers Matter for Pixel-Space Diffusion Transformers

July 6, 2026
Autoren: Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk
cs.AI

Zusammenfassung

Vision Transformers (ViTs) sind dafür bekannt, Patch-Token-Ausreißer mit hoher Norm aufzuweisen, die die Qualität der Merkmalskarten beeinträchtigen – ein Problem, das durch Register-Tokens wirksam gemildert wird. Da Diffusionsmodelle zunehmend Transformer-Architekturen übernehmen und sich in Richtung Pixelraum-Training bewegen, nähern sie sich in ihrer Form den ViTs an, was die Frage aufwirft, ob Register-Tokens auch für Diffusion Transformers (DiTs) nützlich sind. In dieser Arbeit zeigen wir, dass sich DiTs in einem wesentlichen Punkt von ViTs unterscheiden: Sie weisen keine Patch-Token-Ausreißer auf, profitieren aber dennoch von Registern. Interessanterweise sind Register in Pixelraum-DiTs wirksamer als in Latentraum-DiTs. Durch die Analyse von Zwischenrepräsentationen stellen wir fest, dass Register-Tokens bei hohen Rauschpegeln sauberere Merkmalskarten erzeugen, was zu ihrer Wirksamkeit bei der Pixelraumgenerierung beitragen könnte. Wir beobachten ferner, dass aktuelle Pixelraum-DiT-Architekturen implizit registerähnliche Mechanismen integrieren, was teilweise ihre starke empirische Leistung erklären könnte. Motiviert durch diese Beobachtungen schlagen wir *Register Guidance* vor, eine Technik, die den Beitrag von Register-Tokens verstärkt, die für die Verbesserung der visuellen Struktur und Kohärenz verantwortlich sind.
English
Vision Transformers (ViTs) are known to exhibit high-norm patch-token outliers that degrade feature map quality, a problem effectively mitigated by register tokens. As diffusion models increasingly adopt transformer architectures and move toward pixel-space training, they become closer in form to ViTs, raising the question of whether register tokens are also useful for Diffusion Transformers (DiTs). In this work, we show that DiTs differ from ViTs in a key respect: they do not exhibit patch-token outliers but still benefit from registers. Interestingly, registers are more effective in pixel-space DiTs than in latent-space DiTs. By analyzing intermediate representations, we find that register tokens produce cleaner feature maps at high noise levels, which may contribute to their effectiveness in pixel-space generation. We further observe that recent pixel-space DiT architectures implicitly incorporate register-like mechanisms, which may partially account for their strong empirical performance. Motivated by these observations, we propose Register Guidance, a technique that amplifies the contribution of register tokens responsible for improving visual structure and coherence.