ChatPaper.aiChatPaper

Reproduire, analyser et détecter le détournement de récompense dans l'apprentissage par renforcement basé sur des grilles d'évaluation

Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

June 3, 2026
Auteurs: Xuekang Wang, Zhuoyuan Hao, Shuo Hou, Hao Peng, Juanzi Li, Xiaozhi Wang
cs.AI

Résumé

L'apprentissage par renforcement basé sur des grilles d'évaluation (rubric-based RL) utilise un LLM en tant que juge (LaaJ) pour noter les sorties du modèle selon des rubriques servant de récompenses. Cependant, les modèles de politique peuvent exploiter des biais latents dans le juge, entraînant un piratage de récompense et des résultats d'apprentissage inefficaces ou dangereux. Dans les contextes réels d'apprentissage par renforcement basé sur des grilles, ces comportements de piratage sont souvent subtils et entremêlés avec de multiples biais du juge, ce qui les rend difficiles à analyser, détecter et atténuer. Dans cet article, nous présentons CHERRL, un environnement de piratage contrôlable pour l'apprentissage par renforcement basé sur des grilles. En injectant des biais connus dans le LaaJ, CHERRL permet une reproduction stable du piratage de récompense, une observation explicite de la divergence des récompenses et une identification précise du début du piratage. Cela fournit un banc d'essai expérimental propre pour étudier les mécanismes et les atténuations du piratage de récompense dans l'apprentissage par renforcement basé sur des grilles. Pour démontrer son utilité, nous analysons différents biais du juge du point de vue de la découvrabilité et de l'exploitabilité, et explorons un système basé sur des agents pour détecter automatiquement le début du piratage de récompense à partir des journaux d'apprentissage. Le code et l'environnement sont disponibles publiquement sur https://github.com/THUAIS-Lab/CHERRL.
English
Rubric-based reinforcement learning (RL) uses an LLM-as-a-Judge (LaaJ) to score model outputs according to rubrics as rewards. However, policy models may exploit latent biases in the judge, leading to reward hacking and ineffective or unsafe training outcomes. In real-world rubric-based RL, such hacking behaviors are often subtle and entangled with multiple judge biases, making them difficult to analyze, detect, and mitigate. In this paper, we introduce CHERRL, a controllable hacking environment for rubric-based RL. By injecting known biases into LaaJ, CHERRL enables stable reproduction of reward hacking, explicit observation of reward divergence, and precise identification of hacking onset. This provides a clean experimental testbed for studying the mechanisms and mitigations of reward hacking in rubric-based RL. To demonstrate its utility, we analyze different judge biases from the perspectives of discoverability and exploitability, and explore an agent-based system for automatically detecting reward hacking onset from training logs. The code and environment are publicly available at https://github.com/THUAIS-Lab/CHERRL.