GRPO, Dr. GRPO e DAPO São Três Operações em Um Número: A Identidade do Desvio Padrão do Grupo
GRPO, Dr. GRPO, and DAPO Are Three Operations on One Number: The Group-Standard-Deviation Identity
June 30, 2026
Autores: Yong Yi Bay, Kathleen A. Yearick
cs.AI
Resumo
Três dos métodos mais populares para treinar modelos de linguagem a raciocinar parecem três truques diferentes. Não são. Todos ajustam um único número: o desvio padrão, que reflete o quanto as respostas amostradas de um prompt divergem. Quando um desses modelos é treinado, ele responde a cada problema várias vezes, e um verificador automático marca cada resposta como certa ou errada. O desvio padrão dessas marcas mede a discordância: máximo quando as respostas se dividem igualmente entre certas e erradas, e zero quando todas concordam. A Otimização de Política Relativa a Grupo (GRPO) divide por esse número, o GRPO Feito Corretamente (Dr. GRPO) elimina a divisão, e a Otimização de Política com Clip Desacoplado e Amostragem Dinâmica (DAPO) descarta os grupos onde ele é zero. Cada um é apresentado como uma correção própria, no entanto, este artigo prova que são três ajustes de um único dial. Esse dial não é cosmético: para recompensas do tipo certo ou errado, a discordância é exatamente o tamanho da atualização do treinamento — a identidade do desvio padrão do grupo. Um grupo dividido ensina mais, enquanto um grupo unânime não ensina nada e se silencia. O mesmo resultado indica quais problemas merecem maior peso e quantas tentativas cada um necessita. Este artigo confirma a intuição em um grande conjunto de dados reais de dificuldade (Big-Math) e em uma execução de treinamento controlada. O que parece uma etapa de normalização inofensiva é o dial que decide onde o aprendizado ocorre e com que intensidade.
English
Three of the most popular methods for training language models to reason look like three different tricks. They are not. All three adjust a single number: standard deviation, reflecting how much a prompt's sampled answers disagree. When such a model is trained, it answers each problem many times, and an automatic checker marks every answer right or wrong. The standard deviation of those marks measures the disagreement: largest when the answers split evenly between right and wrong, and zero when they all agree. Group Relative Policy Optimization (GRPO) divides by this number, GRPO Done Right (Dr. GRPO) drops the division, and Decoupled Clip and Dynamic Sampling Policy Optimization (DAPO) discards the groups where it is zero. Each is presented as its own fix, yet this paper proves they are three settings of one dial. That dial is not cosmetic: for right-or-wrong rewards, the disagreement is exactly the size of the training update, the group-standard-deviation identity. A split group teaches the most, while a unanimous group teaches nothing and falls silent. The same result says which problems deserve the most weight and how many tries each one needs. This paper confirms the intuition on a large real difficulty dataset (Big-Math) and in a controlled training run. What looks like a harmless normalization step is the dial that decides where learning happens and how strongly.