Architectures d'attention linéaire : Mécanismes, compromis et routage inter-couches
Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing
July 8, 2026
Auteurs: Tommaso Cerruti, Tim Rieder, George Rowlands, Lingfeng Jin, Imanol Schlag
cs.AI
Résumé
L'auto-attention permet à chaque token de récupérer des informations à partir du contexte complet, mais son coût quadratique en fonction de la longueur de séquence limite l'entraînement et l'inférence sur des contextes longs. Cet article présente une étude comparative de l'attention softmax et de quatre architectures récentes d'attention linéaire récurrente : DeltaNet, Gated DeltaNet, Kimi Delta Attention et Gated DeltaNet-2. Nous exprimons ces mécanismes dans une notation commune de mémoire récurrente, rendant explicites leurs différences en termes d'expressivité, de décroissance de la mémoire, de contrôle d'effacement et d'écriture, de débit d'entraînement et de complexité d'implémentation. Nos expériences se concentrent sur des modèles de 350 millions de paramètres entraînés sur 15 milliards de tokens, et incluent des comparaisons d'optimiseurs et de taux d'apprentissage, des comparaisons de piles hybrides versus pures, des mesures de temps d'exécution en fonction de la longueur de séquence, des exécutions plus grandes de DeltaNet à 1,3 et 3 milliards de paramètres, et un petit ensemble d'évaluations en aval. Les résultats de vitesse rapportés mesurent le débit d'entraînement et le temps d'itération ; nous ne fournissons pas de référence empirique de vitesse d'inférence. Dans le balayage rapporté de 350 millions de paramètres et 15 milliards de tokens, Kimi Delta Attention avec Muon atteint la perte de validation finale la plus basse, une pile pure Gated DeltaNet entraînée avec AdamW a le débit d'entraînement normalisé le plus élevé, les piles hybrides améliorent généralement la perte au détriment du débit, et Muon abaisse systématiquement la perte de validation finale par rapport à AdamW dans les configurations d'architecture appariées que nous évaluons. Nous introduisons et évaluons des mécanismes de routage inter-couches légers pour les mémoires de type DeltaNet. La formulation la plus naturelle inspirée de DeltaNet, qui consiste à transmettre l'erreur d'écriture de la règle delta d'une couche inférieure vers la cible de valeur de la couche suivante, n'apporte pas d'amélioration par rapport aux références appariées. Router vers le flux caché aligné et transmettre la valeur d'écriture à la place produit une amélioration modeste dans les exécutions appariées que nous rapportons : le routage de valeur inter-couches (CLVR) abaisse la perte de validation finale pour DeltaNet et Gated DeltaNet.
English
Self-attention lets each token retrieve information from the full context, but its quadratic cost in sequence length limits training and inference at long context. This paper presents a comparative study of softmax attention and four recent recurrent linear-attention architectures: DeltaNet, Gated DeltaNet, Kimi Delta Attention, and Gated DeltaNet-2. We express these mechanisms in a common recurrent-memory notation, making explicit how they differ in expressivity, memory decay, erase and write control, training throughput, and implementation complexity. Our experiments center on 350M-parameter models trained for 15B tokens, and include optimizer and learning-rate comparisons, hybrid-versus-pure stack comparisons, sequence-length runtime measurements, larger DeltaNet runs at 1.3B and 3B parameters, and a small set of downstream evaluations. The reported speed results measure training throughput and iteration time; we do not provide an empirical inference-speed benchmark. Within the reported 350M-parameter, 15B-token sweep, Kimi Delta Attention with Muon reaches the lowest final validation loss, a pure Gated DeltaNet stack trained with AdamW has the highest normalized training throughput, hybrid stacks generally improve loss at a throughput cost, and Muon consistently lowers final validation loss relative to AdamW in the matched architecture settings we evaluate. We introduce and evaluate lightweight cross-layer routing mechanisms for DeltaNet-style memories. The most natural DeltaNet-inspired formulation, forwarding a lower layer's delta-rule write error into the next layer's value target, does not improve over matched baselines. Routing into the aligned hidden stream and forwarding the write value instead yields a modest improvement in the matched runs we report: Cross-Layer Value Routing (CLVR) lowers final validation loss for both DeltaNet and Gated DeltaNet.