ChatPaper.aiChatPaper

Moda Média Gritante: Resíduos de Divisão Média-Variância para Transformadores de Difusão de 1000 Camadas

Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers

May 7, 2026
Autores: Pengqi Lu
cs.AI

Resumo

Escalar Diffusion Transformers (DiTs) para centenas de camadas introduz uma vulnerabilidade estrutural: as redes podem entrar em um estado de colapso silencioso e dominado pela média que homogeneíza as representações dos tokens e suprime a variação centrada. Por meio de auditoria mecanicista, isolamos o evento desencadeador desse colapso como Grito do Modo Médio (Mean Mode Screaming, MMS). O MMS pode ocorrer mesmo quando o treinamento parece estável, com um choque retrógrado coerente com a média nos escritores residuais que abre ramos residuais profundos e leva a rede a um estado dominado pela média. Mostramos que esse comportamento é impulsionado por uma decomposição exata desses gradientes em componentes coerentes com a média e centrados, agravada pela supressão estrutural dos gradientes de logits de atenção através do espaço nulo do Jacobiano da Softmax uma vez que os valores se homogeneízam. Para lidar com isso, propomos os Residuais de Divisão Média-Variância (Mean-Variance Split, MV-Split), que combinam uma atualização residual centrada com ganho separado com uma substituição leaky da média do tronco. Em um DiT de fluxo único com 400 camadas, o MV-Split evita o colapso divergente que quebra a linha de base não estabilizada; ele segue próximo à trajetória pré-colisão da linha de base, enquanto permanece substancialmente melhor do que métodos de gating isotrópico de tokens, como o LayerScale, ao longo de todo o cronograma. Finalmente, apresentamos um DiT de 1000 camadas como uma execução de validação de escala em escalas limite, estabelecendo que a arquitetura permanece treinável de forma estável em profundidade extrema.
English
Scaling Diffusion Transformers (DiTs) to hundreds of layers introduces a structural vulnerability: networks can enter a silent, mean-dominated collapse state that homogenizes token representations and suppresses centered variation. Through mechanistic auditing, we isolate the trigger event of this collapse as Mean Mode Screaming (MMS). MMS can occur even when training appears stable, with a mean-coherent backward shock on residual writers that opens deep residual branches and drives the network into a mean-dominated state. We show this behavior is driven by an exact decomposition of these gradients into mean-coherent and centered components, compounded by the structural suppression of attention-logit gradients through the null space of the Softmax Jacobian once values homogenize. To address this, we propose Mean-Variance Split (MV-Split) Residuals, which combine a separately gained centered residual update with a leaky trunk-mean replacement. On a 400-layer single-stream DiT, MV-Split prevents the divergent collapse that crashes the un-stabilized baseline; it tracks close to the baseline's pre-crash trajectory while remaining substantially better than token-isotropic gating methods such as LayerScale across the full schedule. Finally, we present a 1000-layer DiT as a scale-validation run at boundary scales, establishing that the architecture remains stably trainable at extreme depth.