ChatPaper.aiChatPaper

Repensando o RL para o Raciocínio de LLMs: É Seleção Esparsa de Política, Não Aprendizagem de Capacidade

Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

May 7, 2026
Autores: Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna
cs.AI

Resumo

O aprendizado por reforço tornou-se o padrão para melhorar o raciocínio em modelos de linguagem de grande porte, mas evidências crescentes sugerem que o RL não ensina novas estratégias; ele redistribui massa de probabilidade sobre as soluções que o modelo base já contém. Neste trabalho, perguntamos: se o RL apenas direciona o modelo para caminhos que ele já conhece, o próprio ciclo de otimização do RL é necessário? Por meio de análise em nível de token em várias famílias de modelos e algoritmos de RL, descobrimos que a pegada benéfica do RL é uma correção esparsa e previsível, concentrada em pontos de decisão de alta entropia, onde o modelo está incerto sobre qual ramo seguir. Apenas 1–3% das posições dos tokens são afetadas, o token promovido está sempre entre as cinco principais alternativas do modelo base, e correções direcionadas nessas poucas posições recuperam causalmente grande parte do ganho de precisão do RL, enquanto correções aleatórias falham. A própria entropia do modelo base identifica essas posições sem qualquer modelo treinado com RL, e toda a correção é de baixa dimensionalidade, representável em uma fração minúscula dos parâmetros do modelo. Essas descobertas reformulam a melhoria do raciocínio como seleção esparsa de políticas, e não aquisição de capacidade. Traduzimos essa percepção no ReasonMaxxer, um método mínimo livre de RL que aplica perda contrastiva apenas em pontos de decisão controlados por entropia, usando algumas centenas de rolagens do modelo base e sem geração online. Em três famílias de modelos, seis escalas e seis benchmarks de raciocínio matemático, o ReasonMaxxer iguala ou supera o desempenho total do RL, exigindo apenas dezenas de problemas e minutos de treinamento em GPU única, uma redução no custo de treinamento de aproximadamente três ordens de grandeza.
English
Reinforcement learning has become the standard for improving reasoning in large language models, yet evidence increasingly suggests that RL does not teach new strategies; it redistributes probability mass over solutions the base model already contains. In this work, we ask: if RL merely steers the model toward paths it already knows, is the RL optimization loop itself necessary? Through token-level analysis across multiple model families and RL algorithms, we find that RL's beneficial footprint is a sparse, predictable correction concentrated at high-entropy decision points where the model is uncertain which branch to take. Only 1--3\% of token positions are affected, the promoted token always lies within the base model's top-5 alternatives, and targeted corrections at those few positions causally recover a large fraction of RL's accuracy gain, while random corrections fail. The base model's own entropy identifies these positions without any RL-trained model, and the entire correction is low-dimensional, representable in a tiny fraction of model parameters. These findings reframe reasoning improvement as sparse policy selection, not capability acquisition. We translate this insight into ReasonMaxxer, a minimal RL-free method that applies contrastive loss only at entropy-gated decision points, using a few hundred base-model rollouts and no online generation. Across three model families, six scales, and six math reasoning benchmarks, ReasonMaxxer matches or exceeds full RL performance while requiring only tens of problems and minutes of single-GPU training, a reduction in training cost of roughly three orders of magnitude.