ChatPaper.aiChatPaper

DeepLoop: Масштабирование глубины для циклических трансформеров

DeepLoop: Depth Scaling for Looped Transformers

July 15, 2026
Авторы: Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang
cs.AI

Аннотация

Циклические трансформеры масштабируют последовательные вычисления путем применения компактного набора физических блоков в течение нескольких раундов, увеличивая развернутую глубину без увеличения числа хранимых параметров. Такое повторное использование изменяет задачу масштабирования остаточных связей: в трансформере без разделения весов каждая остаточная ветвь получает и применяет собственное обновление параметров, тогда как в циклическом трансформере одно общее обновление агрегирует градиенты от повторных прохождений и считывается теми же прохождениями на следующем линеаризованном прямом проходе. Мы формализуем этот эффект связанной глубины с помощью границы первого порядка возмущений, контролируемой коэффициентом выравнивания прохождений κ_R. Эта граница восстанавливает показатель степени DeepNorm, когда прохождения декоррелированы, но в консервативном согласованном режиме требует увеличения показателя с 1/4 до 1/2 при росте числа циклов при фиксированной физической глубине. Результирующий метод DeepLoop сохраняет архитектуру Post-LN DeepNorm и устанавливает α=(2N)^{1/2} и β=(8N)^{-1/2} для развернутой глубины N. На циклических языковых моделях типа GPT масштаба GPT-2 small и GPT-2 medium DeepLoop нейтрален, когда физический блок не посещается повторно, и улучшает значение функции потерь на валидации и точность нисходящих задач после активации рекуррентной глубины. Эти результаты показывают, что стабильная рекуррентная глубина требует правил масштабирования остаточных связей, учитывающих обращения к параметрам, а не только номинальное число слоев.
English
Looped Transformers scale sequential computation by applying a compact stack of physical blocks for multiple rounds, increasing unrolled depth without increasing stored parameters. This reuse changes the residual-scaling problem: in an untied Transformer, each residual branch receives and applies its own parameter update, whereas in a looped Transformer one shared update aggregates gradients from repeated visits and is read back by those same visits in the next linearized forward pass. We formalize this tied-depth effect through a first-order perturbation bound controlled by a visit-alignment coefficient κ_R. The bound recovers the DeepNorm exponent when visits decorrelate, but in the conservative aligned regime it requires the exponent to increase from 1/4 to 1/2 as loop count grows at fixed physical depth. The resulting method, DeepLoop, keeps the Post-LN DeepNorm architecture and sets α=(2N)^{1/2} and β=(8N)^{-1/2} for unrolled depth N. On GPT-style looped language models at GPT-2 small and GPT-2 medium scale, DeepLoop is neutral when no physical block is revisited and improves validation loss and downstream accuracy once recurrent depth is activated. These results show that stable recurrent depth requires residual scaling rules that account for parameter visits, not only nominal layer count.