MET: Theorie-gefundeerd en Cultuurbewust Meertalig Moreel Redeneren
MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning
July 13, 2026
Auteurs: Ayoung Lee, Ryan Kwon, Yunxiang Zhang, Yuxuan Liu, Peter Railton, Lu Wang
cs.AI
Samenvatting
Taalmodellen worden steeds vaker ingezet voor morele besluitvorming in uiteenlopende taalkundige en culturele contexten, maar bestaand onderzoek verwaarloost meertaligheid op drie aspecten: 1) meertalige evaluatiebenchmarks gebruiken directe vertaling en passen cultuurspecifieke elementen niet aan; 2) inferentiemethoden voor moreel redeneren steunen op statische, Engelstalige raamwerken en missen een verankering in morele theorie; 3) trainingsmethoden voor morele besluitvorming vereisen doorgaans dure supervisie van sterkere modellen of menselijke annotatoren. Wij vullen deze hiaten aan met drie bijdragen. Ten eerste introduceren we MCLASH, een meertalige benchmark voor morele besluitvorming die cultureel gesitueerde morele intuïties en sociale normen in verschillende talen vastlegt. Ten tweede stellen we MET (Multilingual Ethics with Theory-grounded reasoning) voor, een tweetraps promptmethode gebaseerd op door experts samengestelde, theoretische grondslagen uit de psychologie en filosofie: het model selecteert eerst situatie- en cultuurspecifieke grondslagen en redeneert vervolgens in de moedertaal van de gebruiker. Ten derde introduceren we MET-D (MET-Distillation), dat de tweede stap verbetert via een zelfdistillatietrainingsfase die geen externe supervisie vereist. MET-D verbetert de macro-F1 ten opzichte van het basismodel voor alle drie modellen van verschillende grootte en families (Qwen3-4B, Qwen3-8B, Gemma3-4B) met gemiddeld 3,71 punten op MCLASH en 4,23 op MMoralExceptQA, met een piekverbetering van 12,94 punten voor Maleis op Qwen3-8B. Verder tonen we aan dat MET-D het redeneren in de moedertaal gemiddeld met 62,13 punten verhoogt en dat voordelige grondslagen systematisch verschillen per cultuur. Samen openen deze bijdragen de weg naar cultuurafgestemd, theoretisch onderbouwd meertalig moreel redeneren.
English
Language models are increasingly used for moral decision-making across diverse linguistic and cultural contexts, yet existing work overlooks multilinguality on three aspects: 1) multilingual evaluation benchmarks use direct translation, failing to adapt culture-specific items; 2) inference-time methods for moral reasoning rely on static, English-centric scaffolds and lack grounding in moral theory; 3) training methods for moral decision-making typically require expensive supervision from stronger models or human annotators. We address these gaps with three contributions. First, we introduce MCLASH, a multilingual moral decision-making benchmark to capture culturally situated moral intuitions and social norms across languages. Second, we propose MET (Multilingual Ethics with Theory-grounded reasoning), a two-step prompting method built on expert-curated, theory-based grounds drawn from psychology and philosophy: the model first selects situation- and culture-specific grounds, then reasons over them in the native language of the user. Third, we introduce MET-D (MET-Distillation), which enhances the second step through a self-distillation training stage that requires no external supervision. MET-D improves macro-F1 over the base model on all three models of different sizes and families (Qwen3-4B, Qwen3-8B, Gemma3-4B), by an average of 3.71 points on MCLASH and 4.23 on MMoralExceptQA, with a peak MCLASH gain of 12.94 points for Malay on Qwen3-8B. We further reveal that MET-D increases native-language reasoning by 62.13 points on average, and that beneficial grounds differ systematically across cultures. Together, these contributions open the path for culture-aligned, theory-grounded multilingual moral reasoning.