ChatPaper.aiChatPaper

Is één laag genoeg? Het trainen van een enkele Transformer-laag kan de volledige parameter-RL-training evenaren.

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

July 2, 2026
Auteurs: Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong
cs.AI

Samenvatting

Reinforcement learning (RL) is een centraal onderdeel geworden van de post-training van grote taalmodellen (LLM's), maar er is nog weinig bekend over hoe RL-aanpassing is verdeeld over transformerlagen. Bestaande benaderingen werken doorgaans alle modelparameters uniform bij, met de impliciete aanname dat elke laag een vergelijkbare bijdrage levert aan de winst die tijdens RL-post-training wordt behaald. In dit werk dagen we deze aanname uit door middel van een systematische laagsgewijze studie van RL-training. Verrassend genoeg vinden we dat het trainen van een enkele transformerlaag het grootste deel van de winst van volledige parameter-RL-training kan herwinnen, en in sommige gevallen deze zelfs overtreft. Om dit fenomeen te kwantificeren, introduceren we de grootheid laagbijdrage, die de fractie meet van de volledige RL-verbetering die wordt herwonnen door een laag geïsoleerd te trainen. Over zeven modellen uit twee modelfamilies (Qwen3, Qwen2.5), drie RL-algoritmen (GRPO, GiGPO, Dr. GRPO) en meerdere taakdomeinen, waaronder wiskundig redeneren, codegeneratie en agentische besluitvorming, observeren we een opmerkelijk stabiel patroon: RL-winst is sterk geconcentreerd in een kleine subset van, en in veel gevallen zelfs een enkele, transformerlaag. Nog opvallender is dat hetzelfde structurele patroon consequent naar voren komt: lagen met een hoge bijdrage concentreren zich in het midden van de transformerstack, terwijl lagen nabij de invoer- en uitvoerzijden aanzienlijk minder bijdragen. De resulterende laagrangschikkingen blijven sterk gecorreleerd over datasets, taken, modelfamilies en RL-algoritmen heen.
English
Reinforcement learning (RL) has become a central component of post-training large language models (LLMs), yet little is understood about how RL adaptation is distributed across transformer layers. Existing approaches typically update all model parameters uniformly, implicitly assuming that every layer contributes similarly to the gains obtained during RL post-training. In this work, we challenge this assumption through a systematic layer-wise study of RL training. Surprisingly, we find that training a single transformer layer can recover most of the gains achieved by full-parameter RL training, and in some cases even surpass it. To quantify this phenomenon, we introduce the quantity layer contribution, which measures the fraction of full RL improvement recovered by training a layer in isolation. Across seven models spanning two model families (Qwen3, Qwen2.5), three RL algorithms (GRPO, GiGPO, Dr. GRPO), and multiple task domains including mathematical reasoning, code generation, and agentic decision-making, we observe a remarkably stable pattern: RL gains are highly concentrated in a small subset of, and in many cases even a single, transformer layers. More strikingly, the same structural pattern consistently emerges: high-contribution layers concentrate in the middle of the transformer stack, while layers near the input and output ends contribute substantially less. The resulting layer rankings remain strongly correlated across datasets, tasks, model families, and RL algorithms.