DeepLoop: Escalado de Profundidad para Transformadores en Bucle
DeepLoop: Depth Scaling for Looped Transformers
July 15, 2026
Autores: Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang
cs.AI
Resumen
Los Transformers en bucle escalan el cómputo secuencial aplicando una pila compacta de bloques físicos durante múltiples rondas, aumentando la profundidad desplegada sin incrementar los parámetros almacenados. Esta reutilización modifica el problema de escalado residual: en un Transformer sin ataduras, cada rama residual recibe y aplica su propia actualización de parámetros, mientras que en un Transformer en bucle una actualización compartida agrega los gradientes de visitas repetidas y es leída nuevamente por esas mismas visitas en el siguiente pase directo linealizado. Formalizamos este efecto de profundidad atada mediante un límite de perturbación de primer orden controlado por un coeficiente de alineación de visitas κ_R. El límite recupera el exponente de DeepNorm cuando las visitas se descorrelacionan, pero en el régimen alineado conservador requiere que el exponente aumente de 1/4 a 1/2 a medida que el número de bucles crece con una profundidad física fija. El método resultante, DeepLoop, mantiene la arquitectura Post-LN DeepNorm y establece α=(2N)^{1/2} y β=(8N)^{-1/2} para la profundidad desplegada N. En modelos de lenguaje en bucle estilo GPT a escala GPT-2 pequeña y GPT-2 mediana, DeepLoop es neutral cuando no se revisita ningún bloque físico y mejora la pérdida de validación y la precisión en tareas posteriores una vez que se activa la profundidad recurrente. Estos resultados muestran que la profundidad recurrente estable requiere reglas de escalado residual que tengan en cuenta las visitas a parámetros, no solo el número nominal de capas.
English
Looped Transformers scale sequential computation by applying a compact stack of physical blocks for multiple rounds, increasing unrolled depth without increasing stored parameters. This reuse changes the residual-scaling problem: in an untied Transformer, each residual branch receives and applies its own parameter update, whereas in a looped Transformer one shared update aggregates gradients from repeated visits and is read back by those same visits in the next linearized forward pass. We formalize this tied-depth effect through a first-order perturbation bound controlled by a visit-alignment coefficient κ_R. The bound recovers the DeepNorm exponent when visits decorrelate, but in the conservative aligned regime it requires the exponent to increase from 1/4 to 1/2 as loop count grows at fixed physical depth. The resulting method, DeepLoop, keeps the Post-LN DeepNorm architecture and sets α=(2N)^{1/2} and β=(8N)^{-1/2} for unrolled depth N. On GPT-style looped language models at GPT-2 small and GPT-2 medium scale, DeepLoop is neutral when no physical block is revisited and improves validation loss and downstream accuracy once recurrent depth is activated. These results show that stable recurrent depth requires residual scaling rules that account for parameter visits, not only nominal layer count.