ChatPaper.aiChatPaper

PluraMath : Étendre l'évaluation du raisonnement mathématique au-delà des langues à fortes ressources

PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

July 7, 2026
Auteurs: Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser
cs.AI

Résumé

Le raisonnement mathématique est devenu une tâche centrale pour évaluer et ajuster les grands modèles de langage (LLMs) de raisonnement, mais les références existantes restent fortement biaisées en faveur des langues à hautes ressources, l’anglais et le chinois dominant à la fois les corpus de pré-entraînement et les suites d’évaluation. Le jeu de données PolyMath (Wang et al., 2025), récemment publié, représente une avancée significative, mais sa couverture reste limitée à seulement 18 langues à hautes ressources. Pour combler cette lacune, nous présentons PluraMath, une extension de PolyMath à 18 langues supplémentaires sous-représentées couvrant 6 familles linguistiques – allant de ressources moyennes à des situations de très faibles ressources. Nous avons construit le jeu de données via un pipeline organisé par des humains, où des locuteurs natifs ont validé minutieusement les traductions pré-calculées. En utilisant PluraMath, nous évaluons ensuite 27 LLMs de raisonnement à travers quatre échelles de modèles – petits, moyens, grands et ensembles closed-source – sondant les capacités de raisonnement mathématique multilingue des modèles de pointe dans diverses conditions linguistiques. Notre analyse fine confirme un écart persistant dans les performances de raisonnement mathématique entre les langues à hautes ressources et les langues sous-représentées, les résultats les plus forts étant largement associés à une meilleure capacité à suivre les instructions. Nous open-sourceons intégralement notre jeu de données, notre pipeline d'acquisition de données et notre cadre d'évaluation, dans le but de réduire la barrière au développement de références multilingues pour les communautés sous-représentées.
English
Mathematical reasoning has become a central task for evaluating and tuning reasoning Large Language Models (LLMs), yet existing benchmarks remain heavily biased toward high-resource languages, with English and Chinese dominating both pre-training corpora and evaluation suites. The recently released PolyMath (Wang et al., 2025) dataset represents a significant step forward, yet its coverage is still limited to 18 only high-resource languages. To address this gap, we introduce PluraMath, an extension of PolyMath to 18 additional {underrepresented languages spanning 6 language families -- ranging from mid-resource to extreme low-resource settings. We constructed the dataset through a human-curated pipeline, where native speakers thoroughly validated pre-computed translations. Using PluraMath, we then benchmark 27 reasoning LLMs across four model scales -- small, mid-size, large, and closed-source ensembles -- probing the multilingual mathematical reasoning capabilities of state-of-the-art models under diverse linguistic conditions. Our fine-grained analysis confirms a persistent gap in mathematical reasoning performance between high-resource and underrepresented languages, with stronger results largely associated with better instruction-following ability. We fully open-source our dataset, data acquisition pipeline, and evaluation framework, with the goal of lowering the barrier to multilingual benchmark development for underrepresented communities.