ChatPaper.aiChatPaper

DeepLoop : Mise à l'échelle de la profondeur pour les Transformers bouclés

DeepLoop: Depth Scaling for Looped Transformers

July 15, 2026
Auteurs: Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang
cs.AI

Résumé

Les Transformers en boucle mettent à l’échelle le calcul séquentiel en appliquant une pile compacte de blocs physiques pendant plusieurs tours, ce qui augmente la profondeur déroulée sans accroître les paramètres stockés. Cette réutilisation modifie le problème de mise à l’échelle résiduelle : dans un Transformer non lié, chaque branche résiduelle reçoit et applique sa propre mise à jour des paramètres, tandis que dans un Transformer en boucle, une mise à jour partagée agrège les gradients issus de visites répétées et est relue par ces mêmes visites lors du passage avant linéarisé suivant. Nous formalisons cet effet de profondeur liée à l’aide d’une borne de perturbation du premier ordre contrôlée par un coefficient d’alignement des visites κ_R. Cette borne retrouve l’exposant de DeepNorm lorsque les visites se décorrèlent, mais dans le régime aligné conservateur, elle impose que l’exposant passe de 1/4 à 1/2 lorsque le nombre de boucles augmente à profondeur physique fixe. La méthode qui en résulte, DeepLoop, conserve l’architecture DeepNorm post‑normalisation et fixe α=(2N)^{1/2} et β=(8N)^{-1/2} pour une profondeur déroulée N. Sur des modèles de langage en boucle de style GPT aux échelles GPT-2 small et GPT-2 medium, DeepLoop est neutre lorsqu’aucun bloc physique n’est revisité et améliore la perte de validation ainsi que la précision en aval une fois la profondeur récurrente activée. Ces résultats montrent qu’une profondeur récurrente stable nécessite des règles de mise à l’échelle résiduelle qui tiennent compte des visites de paramètres, et non seulement du nombre nominal de couches.
English
Looped Transformers scale sequential computation by applying a compact stack of physical blocks for multiple rounds, increasing unrolled depth without increasing stored parameters. This reuse changes the residual-scaling problem: in an untied Transformer, each residual branch receives and applies its own parameter update, whereas in a looped Transformer one shared update aggregates gradients from repeated visits and is read back by those same visits in the next linearized forward pass. We formalize this tied-depth effect through a first-order perturbation bound controlled by a visit-alignment coefficient κ_R. The bound recovers the DeepNorm exponent when visits decorrelate, but in the conservative aligned regime it requires the exponent to increase from 1/4 to 1/2 as loop count grows at fixed physical depth. The resulting method, DeepLoop, keeps the Post-LN DeepNorm architecture and sets α=(2N)^{1/2} and β=(8N)^{-1/2} for unrolled depth N. On GPT-style looped language models at GPT-2 small and GPT-2 medium scale, DeepLoop is neutral when no physical block is revisited and improves validation loss and downstream accuracy once recurrent depth is activated. These results show that stable recurrent depth requires residual scaling rules that account for parameter visits, not only nominal layer count.