Van SRA naar Self-Flow: Data-augmentatie of zelfsupervisie?
From SRA to Self-Flow: Data Augmentation or Self-Supervision?
July 2, 2026
Auteurs: Dengyang Jiang, Mengmeng Wang, Harry Yang, Jingdong Wang
cs.AI
Samenvatting
Representatie-uitlijning is een effectieve manier geworden om de training van diffusietransformatoren te versnellen en de generatiekwaliteit te verbeteren. Recente zelfuitlijningsmethoden, zoals SRA en Self-Flow, verwijderen verder de afhankelijkheid van externe voorgetrainde encoders door uitlijning binnen het diffusiemodel zelf te construeren. Het mechanisme achter de verbetering van SRA naar Self-Flow, namelijk dubbele tijdsplanning, is echter nog onvoldoende onderzocht: Self-Flow schrijft zijn winst toe aan interacties tussen tokens op verschillende ruisniveaus, waarbij schonere tokens helpen bij het afleiden van ruizigere. In dit werk herzien we deze verklaring en vragen we ons af of de winst in plaats daarvan afkomstig is van data-augmentatie langs de ruisdimensie. Om deze factoren te ontwarren, introduceren we Aandachtsscheiding, die dezelfde dubbele tijdsstapinvoer als Self-Flow behoudt, terwijl de aandacht tussen tokens die aan verschillende ruisniveaus zijn toegewezen, wordt geblokkeerd. Verrassend genoeg verslechtert het verwijderen van een dergelijke interactie de prestaties niet en kan het deze zelfs verbeteren, wat suggereert dat de verbetering van SRA naar Self-Flow voornamelijk afkomstig is van data-augmentatie. Bovendien tonen we aan dat Aandachtsscheiding zelf een augmentatie-effect biedt door een enkel beeld op te splitsen in meerdere effectieve trainingsonderdelen om de trainingsdata uit te breiden. Op basis van deze observaties combineren we zelfrepresentatie-uitlijning met dubbele tijdsstap- en aandachtsscheiding-augmentatie, en tonen we de effectiviteit van dit ontwerp aan op ImageNet.
English
Representation alignment has become an effective way to accelerate diffusion transformer training and improve generation quality. Recent self-alignment methods, such as SRA and Self-Flow, further remove the dependency on external pretrained encoders by constructing alignment within the diffusion model itself. However, the mechanism behind the improvement from SRA to Self-Flow, dual-time scheduling, remains under-examined: Self-Flow attributes its gain to interactions between tokens at different noise levels, where cleaner tokens help infer noisier ones. In this work, we revisit this explanation and ask whether the gain instead comes from data augmentation along the noise dimension. To disentangle these factors, we introduce Attention Separation, which preserves the same dual-timestep input as Self-Flow while blocking attention between tokens assigned to different noise levels. Surprisingly, removing such interaction does not degrade performance and can even improve it, suggesting that the improvement from SRA to Self-Flow mainly comes from data augmentation. Furthermore,We show that Attention Separation itself provides an augmentation effect by splitting a single image into multiple effective training parts to expand the training data. Based on these observations, we combine self-representation alignment with dual-timestep and attention-separation augmentation, and demonstrate the effectiveness of this design on ImageNet.