Линейные архитектуры внимания: механизмы, компромиссы и кросс-уровневая маршрутизация
Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing
July 8, 2026
Авторы: Tommaso Cerruti, Tim Rieder, George Rowlands, Lingfeng Jin, Imanol Schlag
cs.AI
Аннотация
Само-внимание позволяет каждому токену извлекать информацию из полного контекста, однако его квадратичная стоимость по длине последовательности ограничивает обучение и вывод при длинных контекстах. В данной статье представлено сравнительное исследование softmax-внимания и четырех недавних рекуррентных линейных архитектур внимания: DeltaNet, Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2. Мы выражаем эти механизмы в единой нотации рекуррентной памяти, явно показывая, чем они различаются по выразительности, затуханию памяти, управлению стиранием и записью, пропускной способности обучения и сложности реализации. Наши эксперименты сосредоточены на моделях с 350 миллионами параметров, обученных на 15 миллиардах токенов, и включают сравнение оптимизаторов и скоростей обучения, сравнение гибридных и чистых стеков, измерения времени выполнения в зависимости от длины последовательности, более крупные запуски DeltaNet с 1,3 и 3 миллиардами параметров, а также небольшой набор downstream-оценок. Приведенные результаты по скорости измеряют пропускную способность обучения и время итерации; мы не предоставляем эмпирический эталон скорости вывода. В рамках описанного перебора моделей с 350 миллионами параметров и 15 миллиардами токенов Kimi Delta Attention с Muon достигает наименьших итоговых потерь на валидации, чистый стек Gated DeltaNet, обученный с AdamW, имеет наивысшую нормированную пропускную способность обучения, гибридные стеки в целом улучшают потери ценой снижения пропускной способности, а Muon последовательно снижает итоговые потери на валидации по сравнению с AdamW в оцененных нами конфигурациях с совпадающей архитектурой. Мы вводим и оцениваем легковесные механизмы межслойной маршрутизации для памяти типа DeltaNet. Наиболее естественная формулировка, вдохновленная DeltaNet — передача ошибки записи по дельта-правилу из нижнего слоя в целевое значение следующего слоя — не дает улучшений по сравнению с соответствующими базовыми линиями. Маршрутизация в выровненный скрытый поток и передача значения записи вместо ошибки дает скромное улучшение в сопоставимых запусках, которые мы сообщаем: межслойная маршрутизация значений (CLVR) снижает итоговые потери на валидации как для DeltaNet, так и для Gated DeltaNet.
English
Self-attention lets each token retrieve information from the full context, but its quadratic cost in sequence length limits training and inference at long context. This paper presents a comparative study of softmax attention and four recent recurrent linear-attention architectures: DeltaNet, Gated DeltaNet, Kimi Delta Attention, and Gated DeltaNet-2. We express these mechanisms in a common recurrent-memory notation, making explicit how they differ in expressivity, memory decay, erase and write control, training throughput, and implementation complexity. Our experiments center on 350M-parameter models trained for 15B tokens, and include optimizer and learning-rate comparisons, hybrid-versus-pure stack comparisons, sequence-length runtime measurements, larger DeltaNet runs at 1.3B and 3B parameters, and a small set of downstream evaluations. The reported speed results measure training throughput and iteration time; we do not provide an empirical inference-speed benchmark. Within the reported 350M-parameter, 15B-token sweep, Kimi Delta Attention with Muon reaches the lowest final validation loss, a pure Gated DeltaNet stack trained with AdamW has the highest normalized training throughput, hybrid stacks generally improve loss at a throughput cost, and Muon consistently lowers final validation loss relative to AdamW in the matched architecture settings we evaluate. We introduce and evaluate lightweight cross-layer routing mechanisms for DeltaNet-style memories. The most natural DeltaNet-inspired formulation, forwarding a lower layer's delta-rule write error into the next layer's value target, does not improve over matched baselines. Routing into the aligned hidden stream and forwarding the write value instead yields a modest improvement in the matched runs we report: Cross-Layer Value Routing (CLVR) lowers final validation loss for both DeltaNet and Gated DeltaNet.