Les grands modèles de langage piratent les récompenses, et la société
Large Language Models Hack Rewards, and Society
June 2, 2026
Auteurs: Wei Liu, Xinyi Mou, Hanqi Yan, Zhongyu Wei, Yulan He
cs.AI
Résumé
L'apprentissage par renforcement (RL) est devenu un paradigme dominant de post-entraînement, permettant aux grands modèles de langage (LLM) d'apprendre à partir de récompenses. Nous observons que les réglementations sociétales sont structurellement similaires aux fonctions de récompense : elles définissent des résultats mesurables, des seuils et des exceptions, tout en laissant souvent l'intention institutionnelle partiellement spécifiée. Nous émettons l'hypothèse que le processus d'entraînement par RL peut exploiter ces lacunes et nous nous demandons donc si la tendance bien connue des modèles à manipuler les fonctions de récompense pendant le RL peut dégénérer en un mode de défaillance plus conséquent, que nous nommons piratage sociétal : la découverte de failles dans les règles qui régissent la société. Pour étudier ce phénomène, nous introduisons SocioHack, un bac à sable comprenant 72 environnements sociétaux, et constatons que, dans ces environnements, la manipulation des récompenses émerge naturellement et conduit à la découverte de failles réglementaires. Les modèles apprennent à contourner les règles sociales et génèrent des stratégies qui restent techniquement conformes tout en contrecarrant l'intention réglementaire, et les mécanismes de protection actuels des LLM n'offrent qu'une atténuation limitée. Par conséquent, la collecte de retours en conditions réelles pour l'entraînement des modèles nécessite une prudence accrue, et nous avons besoin d'un paradigme de post-entraînement de nouvelle génération pour itérer en toute sécurité les LLM dans la société réelle.
English
Reinforcement learning (RL) has become a dominant post-training paradigm, enabling large language models (LLMs) to learn from rewards. We observe that societal regulations are structurally similar to reward functions. They define measurable outcomes, thresholds, and exceptions, while often leaving institutional intent only partially specified. We hypothesise that the RL training process may exploit these gaps and therefore ask whether models' well-known tendency to hack reward functions during RL can scale into a more consequential failure mode named societal hacking: discovering loopholes in the rules society runs on. To study this phenomenon, we introduce SocioHack, a sandbox of 72 societal environments, and find that within these environments, reward hacking naturally emerges and leads to regulatory loophole discovery. Models learn to hack the social rules and generate strategies that remain technically compliant while defeating regulatory intent, and current LLM safeguards provide only limited mitigation. Therefore, collecting in-the-wild feedback for model training requires greater caution, and we need a next-generation post-training paradigm for safely iterating LLMs in real society.=