ChatPaper.aiChatPaper

Schreeuwende Gemiddelde Modus: Gemiddelde-Variantie Splitsingsresiduen voor 1000-Laags Diffusie Transformers

Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers

May 7, 2026
Auteurs: Pengqi Lu
cs.AI

Samenvatting

Het schalen van Diffusie-Transformators (DiT's) naar honderden lagen introduceert een structurele kwetsbaarheid: netwerken kunnen een stille, gemiddelde-gedomineerde instortingsstatus betreden die tokenrepresentaties homogeniseert en gecentreerde variatie onderdrukt. Door mechanistische auditing isoleren we de triggergebeurtenis van deze instorting als Gemiddelde Modus Schreeuwen (GMS). GMS kan optreden zelfs wanneer training stabiel lijkt, met een gemiddelde-coherente terugwaartse schok op residuele schrijvers die diepe residuele takken opent en het netwerk in een gemiddelde-gedomineerde toestand drijft. We tonen aan dat dit gedrag wordt aangedreven door een exacte decompositie van deze gradiënten in gemiddelde-coherente en gecentreerde componenten, verergerd door de structurele onderdrukking van attentie-logit gradiënten via de nulruimte van de Softmax Jacobiaan zodra waarden homogeniseren. Om dit aan te pakken stellen we Gemiddelde-Variantie Splitsing (GV-Split) Residuen voor, die een afzonderlijk bekrachtigde gecentreerde residuele update combineren met een lekkende romp-gemiddelde vervanging. Op een 400-laags enkelstroom DiT voorkomt GV-Split de divergente instorting die de niet-gestabiliseerde basislijn laat crashen; het volgt dicht het pre-crash traject van de basislijn terwijl het aanzienlijk beter blijft dan token-isotrope poortmethoden zoals LaagSchaal gedurende het volledige schema. Tot slot presenteren we een 1000-laags DiT als een schaalvalidatierun bij grensschalen, waarmee wordt vastgesteld dat de architectuur stabiel trainbaar blijft op extreme diepte.
English
Scaling Diffusion Transformers (DiTs) to hundreds of layers introduces a structural vulnerability: networks can enter a silent, mean-dominated collapse state that homogenizes token representations and suppresses centered variation. Through mechanistic auditing, we isolate the trigger event of this collapse as Mean Mode Screaming (MMS). MMS can occur even when training appears stable, with a mean-coherent backward shock on residual writers that opens deep residual branches and drives the network into a mean-dominated state. We show this behavior is driven by an exact decomposition of these gradients into mean-coherent and centered components, compounded by the structural suppression of attention-logit gradients through the null space of the Softmax Jacobian once values homogenize. To address this, we propose Mean-Variance Split (MV-Split) Residuals, which combine a separately gained centered residual update with a leaky trunk-mean replacement. On a 400-layer single-stream DiT, MV-Split prevents the divergent collapse that crashes the un-stabilized baseline; it tracks close to the baseline's pre-crash trajectory while remaining substantially better than token-isotropic gating methods such as LayerScale across the full schedule. Finally, we present a 1000-layer DiT as a scale-validation run at boundary scales, establishing that the architecture remains stably trainable at extreme depth.