GRPO, Dr. GRPO en DAPO zijn drie bewerkingen op één getal: de Groep-Standaarddeviatie-identiteit
GRPO, Dr. GRPO, and DAPO Are Three Operations on One Number: The Group-Standard-Deviation Identity
June 30, 2026
Auteurs: Yong Yi Bay, Kathleen A. Yearick
cs.AI
Samenvatting
Drie van de populairste methoden om taalmodellen te trainen in redeneren lijken drie verschillende trucs. Dat zijn ze niet. Alle drie passen ze één getal aan: de standaarddeviatie, die weergeeft in hoeverre de bemonsterde antwoorden van een prompt van elkaar verschillen. Wanneer zo'n model wordt getraind, beantwoordt het elk probleem meerdere keren en markeert een automatische controleur elk antwoord als goed of fout. De standaarddeviatie van die markeringen meet de onenigheid: het grootst wanneer de antwoorden gelijk verdeeld zijn tussen goed en fout, en nul wanneer ze het allemaal eens zijn. Group Relative Policy Optimization (GRPO) deelt door dit getal, GRPO Done Right (Dr. GRPO) laat de deling weg, en Decoupled Clip and Dynamic Sampling Policy Optimization (DAPO) verwijdert de groepen waar het nul is. Elk wordt gepresenteerd als een eigen oplossing, maar dit artikel bewijst dat het drie instellingen van één knop zijn. Die knop is niet cosmetisch: voor goed-foutbeloningen is de onenigheid precies de grootte van de trainingsupdate, de identiteit van de groepstandaarddeviatie. Een verdeelde groep leert het meest, terwijl een unanieme groep niets leert en stilvalt. Hetzelfde resultaat geeft aan welke problemen de meeste aandacht verdienen en hoeveel pogingen elk nodig heeft. Dit artikel bevestigt de intuïtie op een grote dataset met echte moeilijkheid (Big-Math) en in een gecontroleerde trainingsrun. Wat eruitziet als een onschuldige normalisatiestap is de knop die bepaalt waar leren plaatsvindt en hoe sterk.
English
Three of the most popular methods for training language models to reason look like three different tricks. They are not. All three adjust a single number: standard deviation, reflecting how much a prompt's sampled answers disagree. When such a model is trained, it answers each problem many times, and an automatic checker marks every answer right or wrong. The standard deviation of those marks measures the disagreement: largest when the answers split evenly between right and wrong, and zero when they all agree. Group Relative Policy Optimization (GRPO) divides by this number, GRPO Done Right (Dr. GRPO) drops the division, and Decoupled Clip and Dynamic Sampling Policy Optimization (DAPO) discards the groups where it is zero. Each is presented as its own fix, yet this paper proves they are three settings of one dial. That dial is not cosmetic: for right-or-wrong rewards, the disagreement is exactly the size of the training update, the group-standard-deviation identity. A split group teaches the most, while a unanimous group teaches nothing and falls silent. The same result says which problems deserve the most weight and how many tries each one needs. This paper confirms the intuition on a large real difficulty dataset (Big-Math) and in a controlled training run. What looks like a harmless normalization step is the dial that decides where learning happens and how strongly.