ChatPaper.aiChatPaper

Arquitecturas de Atención Lineal: Mecanismos, Compromisos y Enrutamiento entre Capas

Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

July 8, 2026
Autores: Tommaso Cerruti, Tim Rieder, George Rowlands, Lingfeng Jin, Imanol Schlag
cs.AI

Resumen

La autoatención permite que cada token recupere información del contexto completo, pero su costo cuadrático en la longitud de secuencia limita el entrenamiento y la inferencia en contextos largos. Este artículo presenta un estudio comparativo de la atención softmax y cuatro arquitecturas recientes de atención lineal recurrente: DeltaNet, Gated DeltaNet, Kimi Delta Attention y Gated DeltaNet-2. Expresamos estos mecanismos en una notación común de memoria recurrente, explicitando cómo difieren en expresividad, decaimiento de memoria, control de borrado y escritura, rendimiento de entrenamiento y complejidad de implementación. Nuestros experimentos se centran en modelos de 350 millones de parámetros entrenados con 15 mil millones de tokens, e incluyen comparaciones de optimizador y tasa de aprendizaje, comparaciones de pila híbrida versus pura, mediciones de tiempo de ejecución según longitud de secuencia, ejecuciones más grandes de DeltaNet con 1.3 y 3 mil millones de parámetros, y un pequeño conjunto de evaluaciones posteriores. Los resultados de velocidad reportados miden el rendimiento de entrenamiento y el tiempo de iteración; no proporcionamos un punto de referencia empírico de velocidad de inferencia. Dentro del barrido reportado de 350 millones de parámetros y 15 mil millones de tokens, Kimi Delta Attention con Muon alcanza la pérdida de validación final más baja, una pila pura de Gated DeltaNet entrenada con AdamW tiene el rendimiento de entrenamiento normalizado más alto, las pilas híbridas generalmente mejoran la pérdida a costa del rendimiento, y Muon reduce consistentemente la pérdida de validación final en relación con AdamW en las configuraciones de arquitectura emparejadas que evaluamos. Introducimos y evaluamos mecanismos ligeros de enrutamiento entre capas para las memorias estilo DeltaNet. La formulación más natural inspirada en DeltaNet, que reenvía el error de escritura de la regla delta de una capa inferior al objetivo de valor de la capa siguiente, no mejora respecto a las líneas base emparejadas. Enrutar hacia el flujo oculto alineado y reenviar el valor de escritura produce una mejora modesta en las ejecuciones emparejadas que reportamos: el Enrutamiento de Valor entre Capas (CLVR) reduce la pérdida de validación final tanto para DeltaNet como para Gated DeltaNet.
English
Self-attention lets each token retrieve information from the full context, but its quadratic cost in sequence length limits training and inference at long context. This paper presents a comparative study of softmax attention and four recent recurrent linear-attention architectures: DeltaNet, Gated DeltaNet, Kimi Delta Attention, and Gated DeltaNet-2. We express these mechanisms in a common recurrent-memory notation, making explicit how they differ in expressivity, memory decay, erase and write control, training throughput, and implementation complexity. Our experiments center on 350M-parameter models trained for 15B tokens, and include optimizer and learning-rate comparisons, hybrid-versus-pure stack comparisons, sequence-length runtime measurements, larger DeltaNet runs at 1.3B and 3B parameters, and a small set of downstream evaluations. The reported speed results measure training throughput and iteration time; we do not provide an empirical inference-speed benchmark. Within the reported 350M-parameter, 15B-token sweep, Kimi Delta Attention with Muon reaches the lowest final validation loss, a pure Gated DeltaNet stack trained with AdamW has the highest normalized training throughput, hybrid stacks generally improve loss at a throughput cost, and Muon consistently lowers final validation loss relative to AdamW in the matched architecture settings we evaluate. We introduce and evaluate lightweight cross-layer routing mechanisms for DeltaNet-style memories. The most natural DeltaNet-inspired formulation, forwarding a lower layer's delta-rule write error into the next layer's value target, does not improve over matched baselines. Routing into the aligned hidden stream and forwarding the write value instead yields a modest improvement in the matched runs we report: Cross-Layer Value Routing (CLVR) lowers final validation loss for both DeltaNet and Gated DeltaNet.