ChatPaper.aiChatPaper

Uma Camada é Suficiente? Treinar uma Única Camada Transformer Pode Equivaler ao Treinamento RL com Parâmetros Completos

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

July 2, 2026
Autores: Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong
cs.AI

Resumo

O aprendizado por reforço (RL) tornou-se um componente central do pós-treinamento de modelos de linguagem de grande porte (LLMs), mas pouco se sabe sobre como a adaptação por RL se distribui entre as camadas do transformer. Abordagens existentes geralmente atualizam todos os parâmetros do modelo de forma uniforme, assumindo implicitamente que cada camada contribui de maneira semelhante para os ganhos obtidos durante o pós-treinamento com RL. Neste trabalho, desafiamos essa hipótese por meio de um estudo sistemático camada por camada do treinamento com RL. Surpreendentemente, descobrimos que treinar uma única camada do transformer pode recuperar a maior parte dos ganhos alcançados pelo treinamento completo com RL (todos os parâmetros) e, em alguns casos, até superá-los. Para quantificar esse fenômeno, introduzimos a grandeza *contribuição da camada*, que mede a fração da melhoria completa do RL recuperada ao treinar uma camada isoladamente. Em sete modelos abrangendo duas famílias de modelos (Qwen3, Qwen2.5), três algoritmos de RL (GRPO, GiGPO, Dr. GRPO) e múltiplos domínios de tarefas, incluindo raciocínio matemático, geração de código e tomada de decisão agentiva, observamos um padrão notavelmente estável: os ganhos do RL estão altamente concentrados em um pequeno subconjunto de camadas do transformer e, em muitos casos, até mesmo em uma única camada. Mais impressionante, o mesmo padrão estrutural emerge consistentemente: camadas de alta contribuição concentram-se no meio da pilha do transformer, enquanto as camadas próximas às extremidades de entrada e saída contribuem substancialmente menos. As classificações de camadas resultantes permanecem fortemente correlacionadas entre conjuntos de dados, tarefas, famílias de modelos e algoritmos de RL.
English
Reinforcement learning (RL) has become a central component of post-training large language models (LLMs), yet little is understood about how RL adaptation is distributed across transformer layers. Existing approaches typically update all model parameters uniformly, implicitly assuming that every layer contributes similarly to the gains obtained during RL post-training. In this work, we challenge this assumption through a systematic layer-wise study of RL training. Surprisingly, we find that training a single transformer layer can recover most of the gains achieved by full-parameter RL training, and in some cases even surpass it. To quantify this phenomenon, we introduce the quantity layer contribution, which measures the fraction of full RL improvement recovered by training a layer in isolation. Across seven models spanning two model families (Qwen3, Qwen2.5), three RL algorithms (GRPO, GiGPO, Dr. GRPO), and multiple task domains including mathematical reasoning, code generation, and agentic decision-making, we observe a remarkably stable pattern: RL gains are highly concentrated in a small subset of, and in many cases even a single, transformer layers. More strikingly, the same structural pattern consistently emerges: high-contribution layers concentrate in the middle of the transformer stack, while layers near the input and output ends contribute substantially less. The resulting layer rankings remain strongly correlated across datasets, tasks, model families, and RL algorithms.