ChatPaper.aiChatPaper

Arquiteturas de Atenção Linear: Mecanismos, Compensações e Roteamento entre Camadas

Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing

July 8, 2026
Autores: Tommaso Cerruti, Tim Rieder, George Rowlands, Lingfeng Jin, Imanol Schlag
cs.AI

Resumo

A autoatenção permite que cada token recupere informações de todo o contexto, mas seu custo quadrático em relação ao comprimento da sequência limita o treinamento e a inferência com contextos longos. Este artigo apresenta um estudo comparativo entre a atenção softmax e quatro arquiteturas recentes de atenção linear recorrente: DeltaNet, Gated DeltaNet, Kimi Delta Attention e Gated DeltaNet-2. Expressamos esses mecanismos em uma notação comum de memória recorrente, explicitando como eles diferem em expressividade, decaimento de memória, controle de apagamento e escrita, taxa de transferência de treinamento e complexidade de implementação. Nossos experimentos focam em modelos de 350 milhões de parâmetros treinados com 15 bilhões de tokens, e incluem comparações de otimizadores e taxas de aprendizado, comparações de pilhas híbridas versus puras, medições de tempo de execução para diferentes comprimentos de sequência, execuções maiores de DeltaNet com 1,3B e 3B de parâmetros, e um pequeno conjunto de avaliações downstream. Os resultados de velocidade reportados medem a taxa de transferência de treinamento e o tempo por iteração; não fornecemos um benchmark empírico de velocidade de inferência. Dentre as condições reportadas (350M de parâmetros, 15B de tokens), a Kimi Delta Attention com Muon atinge a menor perda de validação final, uma pilha pura de Gated DeltaNet treinada com AdamW apresenta a maior taxa de transferência de treinamento normalizada, pilhas híbridas geralmente melhoram a perda a um custo de taxa de transferência, e o Muon consistentemente reduz a perda de validação final em relação ao AdamW nas configurações de arquitetura pareadas que avaliamos. Introduzimos e avaliamos mecanismos leves de roteamento entre camadas para memórias do estilo DeltaNet. A formulação mais natural inspirada no DeltaNet, que encaminha o erro de escrita da regra delta de uma camada inferior para o alvo de valor da camada seguinte, não melhora em relação às linhas de base pareadas. Roteamento para o fluxo oculto alinhado e encaminhamento do valor de escrita, por outro lado, produz uma melhoria modesta nas execuções pareadas que reportamos: o Roteamento de Valor entre Camadas (CLVR) reduz a perda de validação final tanto para DeltaNet quanto para Gated DeltaNet.
English
Self-attention lets each token retrieve information from the full context, but its quadratic cost in sequence length limits training and inference at long context. This paper presents a comparative study of softmax attention and four recent recurrent linear-attention architectures: DeltaNet, Gated DeltaNet, Kimi Delta Attention, and Gated DeltaNet-2. We express these mechanisms in a common recurrent-memory notation, making explicit how they differ in expressivity, memory decay, erase and write control, training throughput, and implementation complexity. Our experiments center on 350M-parameter models trained for 15B tokens, and include optimizer and learning-rate comparisons, hybrid-versus-pure stack comparisons, sequence-length runtime measurements, larger DeltaNet runs at 1.3B and 3B parameters, and a small set of downstream evaluations. The reported speed results measure training throughput and iteration time; we do not provide an empirical inference-speed benchmark. Within the reported 350M-parameter, 15B-token sweep, Kimi Delta Attention with Muon reaches the lowest final validation loss, a pure Gated DeltaNet stack trained with AdamW has the highest normalized training throughput, hybrid stacks generally improve loss at a throughput cost, and Muon consistently lowers final validation loss relative to AdamW in the matched architecture settings we evaluate. We introduce and evaluate lightweight cross-layer routing mechanisms for DeltaNet-style memories. The most natural DeltaNet-inspired formulation, forwarding a lower layer's delta-rule write error into the next layer's value target, does not improve over matched baselines. Routing into the aligned hidden stream and forwarding the write value instead yields a modest improvement in the matched runs we report: Cross-Layer Value Routing (CLVR) lowers final validation loss for both DeltaNet and Gated DeltaNet.