PluraMath: Ampliando la evaluación del razonamiento matemático más allá de los idiomas de altos recursos
PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages
July 7, 2026
Autores: Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser
cs.AI
Resumen
El razonamiento matemático se ha consolidado como una tarea central para evaluar y ajustar los grandes modelos de lenguaje (LLMs) de razonamiento. Sin embargo, los puntos de referencia existentes siguen estando fuertemente sesgados hacia idiomas de altos recursos, con el inglés y el chino dominando tanto los corpus de preentrenamiento como los conjuntos de evaluación. El conjunto de datos PolyMath, publicado recientemente (Wang et al., 2025), representa un avance significativo, pero su cobertura aún se limita a solo 18 idiomas de altos recursos. Para abordar esta brecha, presentamos PluraMath, una extensión de PolyMath que incorpora 18 idiomas subrepresentados adicionales, abarcando 6 familias lingüísticas —desde idiomas de recursos medios hasta entornos de recursos extremadamente bajos. Construimos el conjunto de datos mediante un canal de curaduría humana, donde hablantes nativos validaron minuciosamente las traducciones precomputadas. Utilizando PluraMath, evaluamos 27 LLMs de razonamiento en cuatro escalas de modelo —pequeña, mediana, grande y conjuntos cerrados— explorando las capacidades de razonamiento matemático multilingüe de los modelos de última generación bajo diversas condiciones lingüísticas. Nuestro análisis detallado confirma una brecha persistente en el rendimiento del razonamiento matemático entre idiomas de altos recursos e idiomas subrepresentados, donde los resultados más sólidos se asocian en gran medida con una mejor capacidad de seguir instrucciones. Publicamos como código abierto nuestro conjunto de datos, el canal de adquisición de datos y el marco de evaluación, con el objetivo de reducir la barrera para el desarrollo de puntos de referencia multilingües para comunidades subrepresentadas.
English
Mathematical reasoning has become a central task for evaluating and tuning reasoning Large Language Models (LLMs), yet existing benchmarks remain heavily biased toward high-resource languages, with English and Chinese dominating both pre-training corpora and evaluation suites. The recently released PolyMath (Wang et al., 2025) dataset represents a significant step forward, yet its coverage is still limited to 18 only high-resource languages. To address this gap, we introduce PluraMath, an extension of PolyMath to 18 additional {underrepresented languages spanning 6 language families -- ranging from mid-resource to extreme low-resource settings. We constructed the dataset through a human-curated pipeline, where native speakers thoroughly validated pre-computed translations. Using PluraMath, we then benchmark 27 reasoning LLMs across four model scales -- small, mid-size, large, and closed-source ensembles -- probing the multilingual mathematical reasoning capabilities of state-of-the-art models under diverse linguistic conditions. Our fine-grained analysis confirms a persistent gap in mathematical reasoning performance between high-resource and underrepresented languages, with stronger results largely associated with better instruction-following ability. We fully open-source our dataset, data acquisition pipeline, and evaluation framework, with the goal of lowering the barrier to multilingual benchmark development for underrepresented communities.