ChatPaper.aiChatPaper

De SRA a Self-Flow: Aumento de Dados ou Auto-Supervisão?

From SRA to Self-Flow: Data Augmentation or Self-Supervision?

July 2, 2026
Autores: Dengyang Jiang, Mengmeng Wang, Harry Yang, Jingdong Wang
cs.AI

Resumo

O alinhamento de representação tornou-se uma forma eficaz de acelerar o treinamento de transformadores de difusão e melhorar a qualidade da geração. Métodos recentes de auto-alinhamento, como SRA e Self-Flow, eliminam ainda a dependência de codificadores pré-treinados externos ao construir o alinhamento dentro do próprio modelo de difusão. No entanto, o mecanismo por trás da melhoria do SRA para o Self-Flow, o agendamento de tempo dual, permanece pouco examinado: o Self-Flow atribui seu ganho às interações entre tokens em diferentes níveis de ruído, onde tokens mais limpos ajudam a inferir os mais ruidosos. Neste trabalho, revisitamos essa explicação e perguntamos se o ganho, em vez disso, provém do aumento de dados ao longo da dimensão de ruído. Para separar esses fatores, introduzimos a Separação de Atenção, que preserva a mesma entrada de dois timesteps do Self-Flow enquanto bloqueia a atenção entre tokens atribuídos a diferentes níveis de ruído. Surpreendentemente, remover tal interação não degrada o desempenho e pode até melhorá-lo, sugerindo que a melhoria do SRA para o Self-Flow vem principalmente do aumento de dados. Além disso, mostramos que a própria Separação de Atenção fornece um efeito de aumento ao dividir uma única imagem em múltiplas partes de treinamento eficazes para expandir os dados de treinamento. Com base nessas observações, combinamos o auto-alinhamento de representação com agendamento de tempo dual e aumento por separação de atenção, e demonstramos a eficácia desse design no ImageNet.
English
Representation alignment has become an effective way to accelerate diffusion transformer training and improve generation quality. Recent self-alignment methods, such as SRA and Self-Flow, further remove the dependency on external pretrained encoders by constructing alignment within the diffusion model itself. However, the mechanism behind the improvement from SRA to Self-Flow, dual-time scheduling, remains under-examined: Self-Flow attributes its gain to interactions between tokens at different noise levels, where cleaner tokens help infer noisier ones. In this work, we revisit this explanation and ask whether the gain instead comes from data augmentation along the noise dimension. To disentangle these factors, we introduce Attention Separation, which preserves the same dual-timestep input as Self-Flow while blocking attention between tokens assigned to different noise levels. Surprisingly, removing such interaction does not degrade performance and can even improve it, suggesting that the improvement from SRA to Self-Flow mainly comes from data augmentation. Furthermore,We show that Attention Separation itself provides an augmentation effect by splitting a single image into multiple effective training parts to expand the training data. Based on these observations, we combine self-representation alignment with dual-timestep and attention-separation augmentation, and demonstrate the effectiveness of this design on ImageNet.