ChatPaper.aiChatPaper

DeepLoop: Diepteschaling voor Geloopte Transformatoren

DeepLoop: Depth Scaling for Looped Transformers

July 15, 2026
Auteurs: Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang
cs.AI

Samenvatting

Geloopte Transformers schalen sequentiële berekening door een compacte stapel fysieke blokken gedurende meerdere rondes toe te passen, waardoor de uitgerolde diepte toeneemt zonder dat het aantal opgeslagen parameters toeneemt. Dit hergebruik verandert het residu-schalingsprobleem: in een ongebonden Transformer ontvangt en past elke residutak zijn eigen parameterupdate toe, terwijl in een geloopte Transformer één gedeelde update gradiënten van herhaalde bezoeken aggregeert en door dezelfde bezoeken wordt teruggelezen in de volgende gelineariseerde voorwaartse doorgang. We formaliseren dit gebonden-diepte-effect via een eerste-orde storingsgrens die wordt geregeld door een coëfficiënt voor bezoek-uitlijning κ_R. De grens herstelt de DeepNorm-exponent wanneer bezoeken decorreleren, maar in het conservatieve uitgelijnde regime vereist het dat de exponent toeneemt van 1/4 naar 1/2 naarmate het aantal lussen groeit bij een vaste fysieke diepte. De resulterende methode, DeepLoop, behoudt de Post-LN DeepNorm-architectuur en stelt α=(2N)^{1/2} en β=(8N)^{-1/2} voor de uitgerolde diepte N. In GPT-achtige geloopte taalmodellen op schaal van GPT-2 small en GPT-2 medium is DeepLoop neutraal wanneer geen fysiek blok opnieuw wordt bezocht en verbetert het de validatieverlies en de downstream-nauwkeurigheid zodra de recurrente diepte wordt geactiveerd. Deze resultaten tonen aan dat stabiele recurrente diepte residu-schalingsregels vereist die rekening houden met parameterbezoeken, niet alleen met het nominale aantal lagen.
English
Looped Transformers scale sequential computation by applying a compact stack of physical blocks for multiple rounds, increasing unrolled depth without increasing stored parameters. This reuse changes the residual-scaling problem: in an untied Transformer, each residual branch receives and applies its own parameter update, whereas in a looped Transformer one shared update aggregates gradients from repeated visits and is read back by those same visits in the next linearized forward pass. We formalize this tied-depth effect through a first-order perturbation bound controlled by a visit-alignment coefficient κ_R. The bound recovers the DeepNorm exponent when visits decorrelate, but in the conservative aligned regime it requires the exponent to increase from 1/4 to 1/2 as loop count grows at fixed physical depth. The resulting method, DeepLoop, keeps the Post-LN DeepNorm architecture and sets α=(2N)^{1/2} and β=(8N)^{-1/2} for unrolled depth N. On GPT-style looped language models at GPT-2 small and GPT-2 medium scale, DeepLoop is neutral when no physical block is revisited and improves validation loss and downstream accuracy once recurrent depth is activated. These results show that stable recurrent depth requires residual scaling rules that account for parameter visits, not only nominal layer count.