ChatPaper.aiChatPaper

¿Es suficiente una sola capa? Entrenar una única capa de Transformer puede igualar al entrenamiento RL de parámetros completos.

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

July 2, 2026
Autores: Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong
cs.AI

Resumen

El aprendizaje por refuerzo (RL, por sus siglas en inglés) se ha convertido en un componente central del entrenamiento posterior de modelos de lenguaje de gran escala (LLMs), aunque se sabe poco acerca de cómo la adaptación mediante RL se distribuye entre las capas del transformer. Los enfoques existentes suelen actualizar todos los parámetros del modelo de manera uniforme, asumiendo implícitamente que cada capa contribuye de forma similar a las mejoras obtenidas durante el entrenamiento posterior con RL. En este trabajo, cuestionamos esta suposición mediante un estudio sistemático capa por capa del entrenamiento con RL. Sorprendentemente, descubrimos que entrenar una sola capa del transformer puede recuperar la mayor parte de las mejoras alcanzadas mediante el entrenamiento completo de parámetros con RL, e incluso superarlas en algunos casos. Para cuantificar este fenómeno, introducimos la cantidad *contribución de capa*, que mide la fracción de la mejora total del RL recuperada al entrenar una capa de forma aislada. A través de siete modelos que abarcan dos familias de modelos (Qwen3, Qwen2.5), tres algoritmos de RL (GRPO, GiGPO, Dr. GRPO) y múltiples dominios de tareas —incluyendo razonamiento matemático, generación de código y toma de decisiones basada en agentes— observamos un patrón notablemente estable: las ganancias del RL se concentran en un subconjunto pequeño de capas del transformer, y en muchos casos incluso en una sola. Más sorprendentemente, el mismo patrón estructural emerge de manera consistente: las capas de alta contribución se concentran en la mitad de la pila del transformer, mientras que las capas cercanas a los extremos de entrada y salida contribuyen sustancialmente menos. Las clasificaciones de capas resultantes se mantienen fuertemente correlacionadas entre conjuntos de datos, tareas, familias de modelos y algoritmos de RL.
English
Reinforcement learning (RL) has become a central component of post-training large language models (LLMs), yet little is understood about how RL adaptation is distributed across transformer layers. Existing approaches typically update all model parameters uniformly, implicitly assuming that every layer contributes similarly to the gains obtained during RL post-training. In this work, we challenge this assumption through a systematic layer-wise study of RL training. Surprisingly, we find that training a single transformer layer can recover most of the gains achieved by full-parameter RL training, and in some cases even surpass it. To quantify this phenomenon, we introduce the quantity layer contribution, which measures the fraction of full RL improvement recovered by training a layer in isolation. Across seven models spanning two model families (Qwen3, Qwen2.5), three RL algorithms (GRPO, GiGPO, Dr. GRPO), and multiple task domains including mathematical reasoning, code generation, and agentic decision-making, we observe a remarkably stable pattern: RL gains are highly concentrated in a small subset of, and in many cases even a single, transformer layers. More strikingly, the same structural pattern consistently emerges: high-contribution layers concentrate in the middle of the transformer stack, while layers near the input and output ends contribute substantially less. The resulting layer rankings remain strongly correlated across datasets, tasks, model families, and RL algorithms.