PluraMath: Uitbreiding van de evaluatie van wiskundig redeneren voorbij hoogbronnentalen
PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages
July 7, 2026
Auteurs: Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser
cs.AI
Samenvatting
Wiskundig redeneren is een centrale taak geworden voor het evalueren en afstemmen van redenerende grote taalmodellen (LLM's), maar bestaande benchmarks blijven sterk vertekend richting talen met hoge resourcebeschikbaarheid, waarbij Engels en Chinees zowel de pre-trainingscorpora als de evaluatiesuites domineren. De recent gepubliceerde PolyMath-dataset (Wang et al., 2025) vormt een belangrijke stap vooruit, maar de dekking ervan blijft beperkt tot slechts 18 talen met hoge resourcebeschikbaarheid. Om deze lacune aan te pakken introduceren we PluraMath, een uitbreiding van PolyMath naar 18 extra ondervertegenwoordigde talen uit 6 taalfamilies – variërend van midden-resource tot extreem lage-resource settings. We hebben de dataset geconstrueerd via een menselijk samengestelde pijplijn, waarbij moedertaalsprekers de vooraf berekende vertalingen grondig hebben gevalideerd. Met behulp van PluraMath benchmarken we vervolgens 27 redenerende LLM's over vier modelschalen – klein, middelgroot, groot en gesloten-bron ensembles – en onderzoeken we de meertalige wiskundige redeneervaardigheden van state-of-the-art modellen onder diverse taalkundige omstandigheden. Onze fijnmazige analyse bevestigt een aanhoudende kloof in wiskundige redeneerprestaties tussen hoog-resourcetalen en ondervertegenwoordigde talen, waarbij sterkere resultaten grotendeels samenhangen met een beter instructievolgende vaardigheid. We stellen onze dataset, data-acquisitiepijplijn en evaluatieframework volledig open-source beschikbaar, met als doel de drempel voor meertalige benchmarkontwikkeling voor ondervertegenwoordigde gemeenschappen te verlagen.
English
Mathematical reasoning has become a central task for evaluating and tuning reasoning Large Language Models (LLMs), yet existing benchmarks remain heavily biased toward high-resource languages, with English and Chinese dominating both pre-training corpora and evaluation suites. The recently released PolyMath (Wang et al., 2025) dataset represents a significant step forward, yet its coverage is still limited to 18 only high-resource languages. To address this gap, we introduce PluraMath, an extension of PolyMath to 18 additional {underrepresented languages spanning 6 language families -- ranging from mid-resource to extreme low-resource settings. We constructed the dataset through a human-curated pipeline, where native speakers thoroughly validated pre-computed translations. Using PluraMath, we then benchmark 27 reasoning LLMs across four model scales -- small, mid-size, large, and closed-source ensembles -- probing the multilingual mathematical reasoning capabilities of state-of-the-art models under diverse linguistic conditions. Our fine-grained analysis confirms a persistent gap in mathematical reasoning performance between high-resource and underrepresented languages, with stronger results largely associated with better instruction-following ability. We fully open-source our dataset, data acquisition pipeline, and evaluation framework, with the goal of lowering the barrier to multilingual benchmark development for underrepresented communities.