ChatPaper.aiChatPaper

MDN: Paralelizando o Momentum Passo a Passo para a Atenção Linear Delta

MDN: Parallelizing Stepwise Momentum for Delta Linear Attention

May 7, 2026
Autores: Yulong Huang, Xiang Liu, Hongxiang Huang, Xiaopeng Lin, Zunchang Liu, Xiaowen Chu, Zeke Xie, Bojun Cheng
cs.AI

Resumo

A Atenção Linear (LA) oferece um paradigma promissor para escalar grandes modelos de linguagem (LLMs) para sequências longas, evitando a complexidade quadrática da autoatenção. Modelos LA recentes, como Mamba2 e GDN, interpretam recorrências lineares como descida de gradiente estocástico (SGD) online em forma fechada, mas atualizações SGD ingênuas sofrem de rápido decaimento de informação e convergência subótima na otimização. Embora otimizadores baseados em momentum forneçam um remédio natural, eles apresentam desafios para alcançar simultaneamente eficiência e eficácia no treinamento. Para lidar com isso, desenvolvemos um algoritmo paralelo por blocos para LA com uma regra de momentum passo a passo, reordenando geometricamente os coeficientes de atualização. Além disso, a partir de uma perspectiva de sistemas dinâmicos, analisamos a recorrência baseada em momentum como um sistema de segunda ordem que introduz autovalores complexos conjugados. Essa análise orienta o projeto de restrições de portão estáveis. O modelo resultante, Momentum DeltaNet (MDN), utiliza kernels Triton para alcançar uma taxa de processamento de treinamento comparável a modelos lineares competitivos como Mamba2 e KDA. Experimentos extensivos em modelos com 400M e 1,3B parâmetros demonstram melhorias consistentes de desempenho em relação a linhas de base fortes, incluindo Transformers, Mamba2 e GDN, em diversos benchmarks de avaliação downstream. Código: https://github.com/HuuYuLong/MomentumDeltaNet .
English
Linear Attention (LA) offers a promising paradigm for scaling large language models (LLMs) to long sequences by avoiding the quadratic complexity of self-attention. Recent LA models such as Mamba2 and GDN interpret linear recurrences as closed-form online stochastic gradient descent (SGD), but naive SGD updates suffer from rapid information decay and suboptimal convergence in optimization. While momentum-based optimizers provide a natural remedy, they pose challenges in simultaneously achieving training efficiency and effectiveness. To address this, we develop a chunkwise parallel algorithm for LA with a stepwise momentum rule by geometrically reordering the update coefficients. Further, from a dynamical systems perspective, we analyze the momentum-based recurrence as a second-order system that introduces complex conjugate eigenvalues. This analysis guides the design of stable gating constraints. The resulting model, Momentum DeltaNet (MDN), leverages Triton kernels to achieve comparable training throughput with competitive linear models such as Mamba2 and KDA. Extensive experiments on the 400M and 1.3B parameter models demonstrate consistent performance improvements over strong baselines, including Transformers, Mamba2 and GDN, across diverse downstream evaluation benchmarks. Code: https://github.com/HuuYuLong/MomentumDeltaNet .