PluraMath: Estendendo a Avaliação de Raciocínio Matemático para Além de Línguas com Muitos Recursos
PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages
July 7, 2026
Autores: Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser
cs.AI
Resumo
O raciocínio matemático tornou-se uma tarefa central para avaliar e ajustar Grandes Modelos de Linguagem (LLMs) de raciocínio, no entanto, os benchmarks existentes permanecem fortemente enviesados em direção a idiomas de alto recurso, com o inglês e o chinês dominando tanto os corpora de pré-treinamento quanto os conjuntos de avaliação. O conjunto de dados PolyMath (Wang et al., 2025), lançado recentemente, representa um avanço significativo, mas sua cobertura ainda está limitada a apenas 18 idiomas de alto recurso. Para preencher essa lacuna, apresentamos o PluraMath, uma extensão do PolyMath para 18 idiomas adicionais sub-representados, abrangendo 6 famílias linguísticas — variando de configurações de recurso médio a recurso extremamente baixo. Construímos o conjunto de dados por meio de um pipeline com curadoria humana, onde falantes nativos validaram minuciosamente traduções pré-computadas. Utilizando o PluraMath, avaliamos 27 LLMs de raciocínio em quatro escalas de modelo — pequeno, médio, grande e conjuntos fechados — investigando as capacidades de raciocínio matemático multilíngue de modelos de última geração sob diversas condições linguísticas. Nossa análise detalhada confirma uma lacuna persistente no desempenho do raciocínio matemático entre idiomas de alto recurso e sub-representados, com resultados mais fortes amplamente associados a uma melhor capacidade de seguir instruções. Disponibilizamos integralmente nosso conjunto de dados, pipeline de aquisição de dados e estrutura de avaliação, com o objetivo de reduzir a barreira para o desenvolvimento de benchmarks multilíngues para comunidades sub-representadas.
English
Mathematical reasoning has become a central task for evaluating and tuning reasoning Large Language Models (LLMs), yet existing benchmarks remain heavily biased toward high-resource languages, with English and Chinese dominating both pre-training corpora and evaluation suites. The recently released PolyMath (Wang et al., 2025) dataset represents a significant step forward, yet its coverage is still limited to 18 only high-resource languages. To address this gap, we introduce PluraMath, an extension of PolyMath to 18 additional {underrepresented languages spanning 6 language families -- ranging from mid-resource to extreme low-resource settings. We constructed the dataset through a human-curated pipeline, where native speakers thoroughly validated pre-computed translations. Using PluraMath, we then benchmark 27 reasoning LLMs across four model scales -- small, mid-size, large, and closed-source ensembles -- probing the multilingual mathematical reasoning capabilities of state-of-the-art models under diverse linguistic conditions. Our fine-grained analysis confirms a persistent gap in mathematical reasoning performance between high-resource and underrepresented languages, with stronger results largely associated with better instruction-following ability. We fully open-source our dataset, data acquisition pipeline, and evaluation framework, with the goal of lowering the barrier to multilingual benchmark development for underrepresented communities.