Lineaire Aandachtsarchitecturen: Mechanismen, Afwegingen en Kruislaagsroutering
Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing
July 8, 2026
Auteurs: Tommaso Cerruti, Tim Rieder, George Rowlands, Lingfeng Jin, Imanol Schlag
cs.AI
Samenvatting
Zelfaandacht stelt elk token in staat om informatie uit de volledige context op te halen, maar de kwadratische kosten in sequentielengte beperken training en inferentie bij lange context. Dit artikel presenteert een vergelijkende studie van softmax-aandacht en vier recente recurrente lineaire-aandachtarchitecturen: DeltaNet, Gated DeltaNet, Kimi Delta Attention en Gated DeltaNet-2. We drukken deze mechanismen uit in een gemeenschappelijke recurrente-geheugennotatie, wat expliciet maakt hoe ze verschillen in expressiviteit, geheugenverval, wissen- en schrijfcontrole, trainingsdoorvoer en implementatiecomplexiteit. Onze experimenten zijn gericht op modellen met 350M parameters, getraind op 15B tokens, en omvatten optimizer- en leersnelheidsvergelijkingen, vergelijkingen van hybride versus pure stacks, looptijdmetingen bij verschillende sequentielengtes, grotere DeltaNet-runs met 1,3B en 3B parameters, en een kleine set downstream-evaluaties. De gerapporteerde snelheidsresultaten meten de trainingsdoorvoer en iteratietijd; we geven geen empirische benchmark van de inferentiesnelheid. Binnen de gerapporteerde sweep met 350M parameters en 15B tokens bereikt Kimi Delta Attention met Muon het laagste uiteindelijke validatieverlies, heeft een pure Gated DeltaNet-stack getraind met AdamW de hoogste genormaliseerde trainingsdoorvoer, verbeteren hybride stacks over het algemeen het verlies ten koste van de doorvoer, en verlaagt Muon consequent het uiteindelijke validatieverlies ten opzichte van AdamW in de gematchte architectuurinstellingen die we evalueren. We introduceren en evalueren lichtgewicht cross-layer routeringsmechanismen voor DeltaNet-achtige geheugens. De meest natuurlijke, op DeltaNet geïnspireerde formulering, waarbij de delta-regel schrijffout van een lagere laag wordt doorgegeven als het waardedoelwit van de volgende laag, levert geen verbetering op ten opzichte van gematchte baselines. Routering naar de uitgelijnde verborgen stroom en het doorgeven van de schrijfwaarde in plaats daarvan levert een bescheiden verbetering op in de gematchde runs die we rapporteren: Cross-Layer Value Routing (CLVR) verlaagt het uiteindelijke validatieverlies voor zowel DeltaNet als Gated DeltaNet.
English
Self-attention lets each token retrieve information from the full context, but its quadratic cost in sequence length limits training and inference at long context. This paper presents a comparative study of softmax attention and four recent recurrent linear-attention architectures: DeltaNet, Gated DeltaNet, Kimi Delta Attention, and Gated DeltaNet-2. We express these mechanisms in a common recurrent-memory notation, making explicit how they differ in expressivity, memory decay, erase and write control, training throughput, and implementation complexity. Our experiments center on 350M-parameter models trained for 15B tokens, and include optimizer and learning-rate comparisons, hybrid-versus-pure stack comparisons, sequence-length runtime measurements, larger DeltaNet runs at 1.3B and 3B parameters, and a small set of downstream evaluations. The reported speed results measure training throughput and iteration time; we do not provide an empirical inference-speed benchmark. Within the reported 350M-parameter, 15B-token sweep, Kimi Delta Attention with Muon reaches the lowest final validation loss, a pure Gated DeltaNet stack trained with AdamW has the highest normalized training throughput, hybrid stacks generally improve loss at a throughput cost, and Muon consistently lowers final validation loss relative to AdamW in the matched architecture settings we evaluate. We introduce and evaluate lightweight cross-layer routing mechanisms for DeltaNet-style memories. The most natural DeltaNet-inspired formulation, forwarding a lower layer's delta-rule write error into the next layer's value target, does not improve over matched baselines. Routing into the aligned hidden stream and forwarding the write value instead yields a modest improvement in the matched runs we report: Cross-Layer Value Routing (CLVR) lowers final validation loss for both DeltaNet and Gated DeltaNet.