ChatPaper.aiChatPaper

Examen de la ressemblance au niveau des résultats et de l'alignement au niveau des mécanismes dans les décisions de risque des LLM : données issues du jeu de Saint-Pétersbourg

Probing Outcome-Level Resemblance and Mechanism-Level Alignment in LLM Risk Decisions: Evidence from the St. Petersburg Game

June 3, 2026
Auteurs: Chensong Huang, Changyu Chen, Chenwei Lin, Hanjia Lyu, Xian Xu, Jiebo Luo
cs.AI

Résumé

Les LLM peuvent sembler prudents dans les tâches de prise de décision risquée, mais des sorties d'apparence prudente n'indiquent pas nécessairement un alignement avec les mécanismes décisionnels humains. Nous étudions cette distinction en utilisant le jeu de Saint-Pétersbourg comme banc d'essai contrôlé, paradoxe classique dans lequel le gain espéré est infini, alors que les humains déclarent généralement une disposition à payer faible et finie. Nous évaluons 28 LLM avec une suite structurée de prompts incluant le jeu original ; des variantes décisionnelles contrôlées qui perturbent la troncature, le jeu répété, la dotation numérique et l'identité professionnelle ; un prompt de perspective humaine qui demande aux modèles de raisonner comme des décideurs humains ; et des comparaisons appariées entre les modèles de base et leurs homologues ajustés par instructions. Dans le jeu original, la plupart des modèles génèrent des offres finies, créant l'apparence d'un comportement de risque similaire à celui des humains. Cependant, cette ressemblance au niveau des résultats masque des différences substantielles au niveau des mécanismes. Les variantes contrôlées révèlent que, plutôt que de maintenir un comportement semblable à celui des humains observé dans le jeu original, les modèles adoptent souvent un comportement conditionnellement et computationnellement rationnel. L'utilisation d'indices humains dans les prompts et l'ajustement par instructions réduisent souvent les offres et atténuent certaines pathologies visibles, mais la plupart des schémas de réponse au niveau des mécanismes restent largement inchangés. Ces résultats montrent que l'alignement comportemental dans la prise de décision risquée peut être superficiel : les LLM peuvent produire des décisions de risque semblables à celles des humains sans présenter des mécanismes cohérents avec ces derniers. Les évaluations à enjeux élevés de la prise de décision des LLM devraient donc aller au-delà de la similarité des résultats et examiner si l'alignement est soutenu par une cohérence au niveau des mécanismes.
English
LLMs can appear cautious in risk decision-making tasks, yet cautious-looking outputs do not necessarily indicate alignment with human decision-making mechanisms. We investigate this distinction using the St. Petersburg game as a controlled testbed, a classical paradox in which the expected payoff is infinite, yet humans typically report low, finite willingness to pay. We evaluate 28 LLMs with a structured prompt suite that includes the original game; controlled decision variants that perturb truncation, repeated play, numeric endowment, and occupational identity; a human-perspective prompt that asks models to reason as human decision makers; and paired comparisons between base models and their instruction-tuned counterparts. In the original game, most models generate finite bids, creating the appearance of human-like risk behavior. However, this outcome-level resemblance masks substantial mechanism-level differences. The controlled variants reveal that rather than maintaining human-like behavior seen in the original game, models often shift to conditionally and computationally rational behavior. Human-cue prompting and instruction tuning often lower bids and reduce some visible pathologies, but most mechanism-level response patterns remain largely unchanged. These findings show that behavioral alignment in risk decision-making can be surface-level: LLMs may produce human-like risk decisions without exhibiting human-consistent mechanisms. High-stakes evaluations of LLM decision-making should therefore move beyond outcome similarity and examine whether the alignment is supported by mechanism-level consistency.