ChatPaper.aiChatPaper

Representatie-uitlijning voor rechtvaardige beeldtransformers is niet eenvoudiger dan je denkt

Representation Alignment for Just Image Transformers is not Easier than You Think

March 15, 2026
Auteurs: Jaeyo Shin, Jiwook Kim, Hyunjung Shim
cs.AI

Samenvatting

Representatie-uitlijning (REPA) is naar voren gekomen als een eenvoudige manier om de training van Diffusion Transformers in latente ruimte te versnellen. Tegelijkertijd hebben pixelruimte-diffusietransformers zoals Just Image Transformers (JiT) groeiende aandacht getrokken omdat ze een afhankelijkheid van een voorgetrainde tokenizer verwijderen en zo de reconstructiebottleneck van latente diffusie vermijden. Dit artikel toont aan dat REPA kan falen voor JiT. REPA levert een slechtere FID op voor JiT naarmate de training vordert en doet de diversiteit instorten op beeldsubsets die sterk geclusterd zijn in de representatieruimte van een voorgetrainde semantische encoder op ImageNet. Wij herleiden het falen tot een informatie-asymmetrie: denoiseren vindt plaats in de hoogdimensionale beeldruimte, terwijl het semantische doel sterk gecomprimeerd is, waardoor directe regressie een kortsluitingsdoelstelling wordt. Wij stellen PixelREPA voor, dat het uitlijningsdoel transformeert en de uitlijning beperkt met een Gemaskeerde Transformer Adapter die een ondiepe transformer-adapter combineert met gedeeltelijke token-masking. PixelREPA verbetert zowel de trainingsconvergentie als de uiteindelijke kwaliteit. PixelREPA reduceert de FID van 3,66 naar 3,17 voor JiT-B/16 en verbetert de Inception Score (IS) van 275,1 naar 284,6 op ImageNet 256×256, terwijl het een >2× snellere convergentie bereikt. Ten slotte behaalt PixelREPA-H/16 een FID=1,81 en IS=317,2. Onze code is beschikbaar op https://github.com/kaist-cvml/PixelREPA.
English
Representation Alignment (REPA) has emerged as a simple way to accelerate Diffusion Transformers training in latent space. At the same time, pixel-space diffusion transformers such as Just image Transformers (JiT) have attracted growing attention because they remove a dependency on a pretrained tokenizer, and then avoid the reconstruction bottleneck of latent diffusion. This paper shows that the REPA can fail for JiT. REPA yields worse FID for JiT as training proceeds and collapses diversity on image subsets that are tightly clustered in the representation space of pretrained semantic encoder on ImageNet. We trace the failure to an information asymmetry: denoising occurs in the high dimensional image space, while the semantic target is strongly compressed, making direct regression a shortcut objective. We propose PixelREPA, which transforms the alignment target and constrains alignment with a Masked Transformer Adapter that combines a shallow transformer adapter with partial token masking. PixelREPA improves both training convergence and final quality. PixelREPA reduces FID from 3.66 to 3.17 for JiT-B/16 and improves Inception Score (IS) from 275.1 to 284.6 on ImageNet 256 times 256, while achieving > 2times faster convergence. Finally, PixelREPA-H/16 achieves FID=1.81 and IS=317.2. Our code is available at https://github.com/kaist-cvml/PixelREPA.