ChatPaper.aiChatPaper

Reward Hacking in Rubriek-gebaseerd Reinforcement Learning

Reward Hacking in Rubric-Based Reinforcement Learning

May 12, 2026
Auteurs: Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu, Yunzhong He
cs.AI

Samenvatting

Reinforcement learning met verifieerbare beloningen heeft sterke post-training winsten mogelijk gemaakt in domeinen zoals wiskunde en programmeren, hoewel veel open-einde instellingen afhankelijk zijn van rubriekgebaseerde beloningen. We bestuderen reward hacking in rubriekgebaseerde RL, waarbij een beleid wordt geoptimaliseerd tegen een trainingsverificateur maar geëvalueerd tegen een paneel van drie frontier-beoordelaars uit verschillende families, waardoor de afhankelijkheid van een enkele evaluator wordt verminderd. Ons raamwerk onderscheidt twee bronnen van divergentie: verificateurfalen, waarbij de trainingsverificateur rubriekcriteria toekent die referentieverificateurs afwijzen, en rubriekontwerplimitaties, waarbij zelfs sterke rubriekgebaseerde verificateurs de voorkeur geven aan antwoorden die rubriekvrije beoordelaars over het algemeen slechter beoordelen. In medische en wetenschappelijke domeinen produceren zwakke verificateurs grote proxy-beloningswinsten die niet overdragen naar de referentieverificateurs; exploitatie neemt toe gedurende de training en concentreert zich in terugkerende fouten zoals gedeeltelijke voldoening aan samengestelde criteria, het behandelen van impliciete inhoud als expliciet, en onnauwkeurige topische matching. Sterkere verificateurs verminderen substantieel, maar elimineren niet, verificateurexploitatie. We introduceren ook een zelfinternalisatiekloof, een verificateurvrije diagnostiek op basis van beleidslogkansen, die de kwaliteit van de referentieverificateur volgt en detecteert wanneer het met de zwakke verificateur getrainde beleid stopt met verbeteren. Ten slotte, in onze setting, voorkomt sterkere verificatie geen reward hacking wanneer de rubriek belangrijke faalmodi ongespecificeerd laat: rubriekgebaseerde verificateurs geven de voorkeur aan de RL-checkpoint, terwijl rubriekvrije beoordelaars de voorkeur geven aan het basismodel. Deze meningsverschillen vallen samen met winsten geconcentreerd in volledigheid en aanwezigheidsgebaseerde criteria, naast dalingen in feitelijke correctheid, beknoptheid, relevantie en algehele kwaliteit. Samen suggereren deze resultaten dat sterkere verificatie reward hacking vermindert, maar op zichzelf niet garandeert dat rubriekwinsten overeenkomen met bredere kwaliteitswinsten.
English
Reinforcement learning with verifiable rewards has enabled strong post-training gains in domains such as math and coding, though many open-ended settings rely on rubric-based rewards. We study reward hacking in rubric-based RL, where a policy is optimized against a training verifier but evaluated against a cross-family panel of three frontier judges, reducing dependence on any single evaluator. Our framework separates two sources of divergence: verifier failure, where the training verifier credits rubric criteria that reference verifiers reject, and rubric-design limitations, where even strong rubric-based verifiers favor responses that rubric-free judges rate worse overall. Across medical and science domains, weak verifiers produce large proxy-reward gains that do not transfer to the reference verifiers; exploitation grows over training and concentrates in recurring failures such as partial satisfaction of compound criteria, treating implicit content as explicit, and imprecise topical matching. Stronger verifiers substantially reduce, but do not eliminate, verifier exploitation. We also introduce a self-internalization gap, a verifier-free diagnostic based on policy log-probabilities, which tracks reference-verifier quality, detecting when the policy trained using the weak verifier stops improving. Finally, in our setting, stronger verification does not prevent reward hacking when the rubric leaves important failure modes unspecified: rubric-based verifiers prefer the RL checkpoint, while rubric-free judges prefer the base model. These disagreements coincide with gains concentrated in completeness and presence-based criteria, alongside declines in factual correctness, conciseness, relevance, and overall quality. Together, these results suggest that stronger verification reduces reward hacking, but does not by itself ensure that rubric gains correspond to broader quality gains.