Além do Raciocínio: A Aprendizagem por Reforço Desbloqueia o Conhecimento Paramétrico em LLMs
Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs
May 8, 2026
Autores: Wanli Yang, Hongyu Zang, Junwei Zhang, Wenjie Shi, Du Su, Jingang Wang, Xueqi Cheng, Fei Sun
cs.AI
Resumo
O aprendizado por reforço (RL) tem alcançado sucesso notável no raciocínio de LLMs, mas ainda é uma questão em aberto se ele também pode melhorar a recordação direta de conhecimento paramétrico. Estudamos esta questão em um ambiente controlado de resposta a perguntas (QA) zero-shot, de um salto e em livro fechado, sem cadeia de pensamento, treinando apenas com recompensas binárias de acerto e aplicando deduplicação treino-teste em nível de fato para garantir que os ganhos reflitam melhora na recordação, e não raciocínio ou memorização. Em três famílias de modelos e múltiplos benchmarks de QA factual, RL produz ganhos relativos médios de ~27%, superando tanto as linhas de base de treinamento quanto de inferência. Mecanicamente, RL redistribui principalmente a massa de probabilidade sobre o conhecimento existente, em vez de adquirir novos fatos, movendo respostas corretas da cauda de baixa probabilidade para gerações gulosas confiáveis. Nosso estudo de atribuição de dados revela que os exemplos mais difíceis são os mais informativos: aqueles cujas respostas nunca aparecem em 128 amostras pré-RL (apenas ~18% dos dados de treinamento) impulsionam ~83% do ganho, já que amostras corretas raras ainda emergem durante o treinamento e são reforçadas. Juntos, esses achados ampliam o papel do RL além do raciocínio, reposicionando-o como uma ferramenta para desbloquear, em vez de adquirir, conhecimento paramétrico latente.
English
Reinforcement learning (RL) has achieved remarkable success in LLM reasoning, but whether it can also improve direct recall of parametric knowledge remains an open question. We study this question in a controlled zero-shot, one-hop, closed-book QA setting with no chain-of-thought, training only on binary correctness rewards and applying fact-level train-test deduplication to ensure gains reflect improved recall rather than reasoning or memorization. Across three model families and multiple factual QA benchmarks, RL yields ~27% average relative gains, surpassing both training- and inference-time baselines alike. Mechanistically, RL primarily redistributes probability mass over existing knowledge rather than acquiring new facts, moving correct answers from the low-probability tail into reliable greedy generations. Our data-attribution study reveals that the hardest examples are the most informative: those whose answers never appear in 128 pre-RL samples (only ~18% of training data) drive ~83% of the gain, since rare correct rollouts still emerge during training and get reinforced. Together, these findings broaden the role of RL beyond reasoning, repositioning it as a tool for unlocking rather than acquiring latent parametric knowledge.