ChatPaper.aiChatPaper

Une seule couche suffit-elle ? L'entraînement d'une seule couche de transformateur peut égaler l'entraînement RL à paramètres complets.

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

July 2, 2026
Auteurs: Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong
cs.AI

Résumé

L'apprentissage par renforcement (RL) est devenu un composant central du post-entraînement des grands modèles de langage (LLMs), mais on comprend encore peu comment l'adaptation par RL se répartit entre les couches du transformeur. Les approches existantes mettent généralement à jour uniformément tous les paramètres du modèle, en supposant implicitement que chaque couche contribue de manière similaire aux gains obtenus lors du post-entraînement par RL. Dans ce travail, nous remettons en question cette hypothèse à travers une étude systématique, couche par couche, de l'entraînement RL. De manière surprenante, nous découvrons que l'entraînement d'une seule couche du transformeur peut récupérer la plupart des gains obtenus par un entraînement RL complet sur tous les paramètres, et dans certains cas même le surpasser. Pour quantifier ce phénomène, nous introduisons la quantité *contribution des couches*, qui mesure la fraction de l'amélioration complète du RL récupérée en entraînant une couche isolément. À travers sept modèles appartenant à deux familles (Qwen3, Qwen2.5), trois algorithmes de RL (GRPO, GiGPO, Dr. GRPO), et plusieurs domaines de tâches incluant le raisonnement mathématique, la génération de code et la prise de décision agentique, nous observons un motif remarquablement stable : les gains du RL sont fortement concentrés dans un petit sous-ensemble de couches du transformeur, et souvent même dans une seule couche. Plus frappant encore, le même motif structurel émerge systématiquement : les couches à forte contribution se concentrent au milieu de la pile du transformeur, tandis que les couches proches des extrémités d'entrée et de sortie contribuent beaucoup moins. Les classements de couches qui en résultent restent fortement corrélés entre les ensembles de données, les tâches, les familles de modèles et les algorithmes de RL.
English
Reinforcement learning (RL) has become a central component of post-training large language models (LLMs), yet little is understood about how RL adaptation is distributed across transformer layers. Existing approaches typically update all model parameters uniformly, implicitly assuming that every layer contributes similarly to the gains obtained during RL post-training. In this work, we challenge this assumption through a systematic layer-wise study of RL training. Surprisingly, we find that training a single transformer layer can recover most of the gains achieved by full-parameter RL training, and in some cases even surpass it. To quantify this phenomenon, we introduce the quantity layer contribution, which measures the fraction of full RL improvement recovered by training a layer in isolation. Across seven models spanning two model families (Qwen3, Qwen2.5), three RL algorithms (GRPO, GiGPO, Dr. GRPO), and multiple task domains including mathematical reasoning, code generation, and agentic decision-making, we observe a remarkably stable pattern: RL gains are highly concentrated in a small subset of, and in many cases even a single, transformer layers. More strikingly, the same structural pattern consistently emerges: high-contribution layers concentrate in the middle of the transformer stack, while layers near the input and output ends contribute substantially less. The resulting layer rankings remain strongly correlated across datasets, tasks, model families, and RL algorithms.