ChatPaper.aiChatPaper

PluraMath: Расширение оценки математического рассуждения за пределы высокоресурсных языков

PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

July 7, 2026
Авторы: Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser
cs.AI

Аннотация

Математическое рассуждение стало центральной задачей для оценки и настройки больших языковых моделей (БЯМ), способных к рассуждению, однако существующие бенчмарки остаются сильно смещёнными в сторону языков с высокими ресурсами: английский и китайский доминируют как в предобучающих корпусах, так и в оценочных наборах. Недавно опубликованный набор данных PolyMath (Wang et al., 2025) представляет собой значительный шаг вперёд, однако его охват по-прежнему ограничен только 18 языками с высокими ресурсами. Для устранения этого пробела мы представляем PluraMath — расширение PolyMath на 18 дополнительных недостаточно представленных языков, охватывающих 6 языковых семей — от языков со средним уровнем ресурсов до языков с крайне низким уровнем ресурсов. Мы создали набор данных с помощью человеческого курированного конвейера, в ходе которого носители языка тщательно проверяли предварительно вычисленные переводы. Используя PluraMath, мы затем провели бенчмаркинг 27 БЯМ для рассуждения в четырёх масштабах моделей — малых, средних, больших и ансамблей с закрытым исходным кодом — исследуя многоязычные способности к математическому рассуждению моделей передового уровня в различных лингвистических условиях. Наш детальный анализ подтверждает сохраняющийся разрыв в производительности математического рассуждения между языками с высокими ресурсами и недостаточно представленными языками, причём более высокие результаты в значительной степени связаны с лучшей способностью следовать инструкциям. Мы полностью публикуем с открытым исходным кодом наш набор данных, конвейер сбора данных и систему оценки с целью снижения барьера для создания многоязычных бенчмарков в сообществах с недостаточной представленностью.
English
Mathematical reasoning has become a central task for evaluating and tuning reasoning Large Language Models (LLMs), yet existing benchmarks remain heavily biased toward high-resource languages, with English and Chinese dominating both pre-training corpora and evaluation suites. The recently released PolyMath (Wang et al., 2025) dataset represents a significant step forward, yet its coverage is still limited to 18 only high-resource languages. To address this gap, we introduce PluraMath, an extension of PolyMath to 18 additional {underrepresented languages spanning 6 language families -- ranging from mid-resource to extreme low-resource settings. We constructed the dataset through a human-curated pipeline, where native speakers thoroughly validated pre-computed translations. Using PluraMath, we then benchmark 27 reasoning LLMs across four model scales -- small, mid-size, large, and closed-source ensembles -- probing the multilingual mathematical reasoning capabilities of state-of-the-art models under diverse linguistic conditions. Our fine-grained analysis confirms a persistent gap in mathematical reasoning performance between high-resource and underrepresented languages, with stronger results largely associated with better instruction-following ability. We fully open-source our dataset, data acquisition pipeline, and evaluation framework, with the goal of lowering the barrier to multilingual benchmark development for underrepresented communities.