Verder dan redeneren: Reinforcement Learning ontsluit parametrische kennis in LLM's
Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs
May 8, 2026
Auteurs: Wanli Yang, Hongyu Zang, Junwei Zhang, Wenjie Shi, Du Su, Jingang Wang, Xueqi Cheng, Fei Sun
cs.AI
Samenvatting
Reinforcement learning (RL) heeft opmerkelijk succes geboekt bij het redeneren van grote taalmodellen (LLM's), maar of het ook directe recall van parametrische kennis kan verbeteren, blijft een open vraag. We bestuderen deze vraag in een gecontroleerde nul-shot, eenstaps, gesloten-boek QA-omgeving zonder gedachteketen, waarbij we alleen trainen op binaire correctheidsbeloningen en deduplicatie op feitniveau tussen training en test toepassen om te garanderen dat verbeteringen een weerspiegeling zijn van verbeterde recall in plaats van redeneren of memorisatie. Over drie modelfamilies en meerdere feitelijke QA-benchmarks heen levert RL gemiddeld ~27% relatieve winst op, waarmee het zowel trainings- als inferentie-tijd baselines overtreft. Mechanistisch gezien herverdeelt RL voornamelijk de waarschijnlijkheidsmassa over bestaande kennis in plaats van nieuwe feiten te verwerven, waarbij correcte antwoorden van de lage-waarschijnlijkheidsstaart naar betrouwbare gulzige generaties worden verplaatst. Onze data-attributiestudie toont aan dat de moeilijkste voorbeelden het meest informatief zijn: die waarvan de antwoorden nooit voorkomen in 128 pre-RL samples (slechts ~18% van de trainingsdata) drijven ~83% van de winst aan, omdat zeldzame correcte rollouts tijdens de training nog steeds verschijnen en worden versterkt. Samen verbreden deze bevindingen de rol van RL verder dan redeneren, en herpositioneren het als een hulpmiddel voor het ontsluiten in plaats van verwerven van latente parametrische kennis.
English
Reinforcement learning (RL) has achieved remarkable success in LLM reasoning, but whether it can also improve direct recall of parametric knowledge remains an open question. We study this question in a controlled zero-shot, one-hop, closed-book QA setting with no chain-of-thought, training only on binary correctness rewards and applying fact-level train-test deduplication to ensure gains reflect improved recall rather than reasoning or memorization. Across three model families and multiple factual QA benchmarks, RL yields ~27% average relative gains, surpassing both training- and inference-time baselines alike. Mechanistically, RL primarily redistributes probability mass over existing knowledge rather than acquiring new facts, moving correct answers from the low-probability tail into reliable greedy generations. Our data-attribution study reveals that the hardest examples are the most informative: those whose answers never appear in 128 pre-RL samples (only ~18% of training data) drive ~83% of the gain, since rare correct rollouts still emerge during training and get reinforced. Together, these findings broaden the role of RL beyond reasoning, repositioning it as a tool for unlocking rather than acquiring latent parametric knowledge.