Soohak : un benchmark conçu par des mathématiciens pour évaluer les capacités mathématiques de niveau recherche des LLMs
Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs
May 9, 2026
Auteurs: Guijin Son, Seungone Kim, Catherine Arnett, Hyunwoo Ko, Hyein Lee, Hyeonah Kang, Jiang Longxi, Jin Yun, JungYup Lee, Kyungmin Lee, Sam Yoosuk Kim, Sang Park, Seunghyeok Hong, SeungJae Lee, Seungyeop Yi, Shinae Shin, SunHye Bok, Sunyoung Shin, Yonghoon Ji, Youngtaek Kim, Hanearl Jung, Akari Asai, Graham Neubig, Sean Welleck, Youngjae Yu, Akshelin R, Alexander B. Ivanov, Boboev Muhammadjon, Chaeyoung Han, Christian Stump, Dmitrii Karp, Dohyun Kwon, DoYong Kwon, Duk-Soon Oh, Giovanni Resta, Greta Panova, Huiyun Noh, Hyungryul Baik, Hyungsun Bae, Inomov Mashrafdzhon, Jeewon Kim, Ji Eun Lee, Jiaqi Liu, Jieui Kang, Jimin Kim, Jon-Lark Kim, Junseo Yoon, Junwoo Jo, Kibeom Kim, Kiwoon Kwon, Mario Kummer, Max Mercer, Minjun Kim, Nahyun Lee, Ng Ze-An, Rafał Marcin Łochowski, Raphaël Lachièze-Rey, Ruichen Zhang, Sejin Park, Seonguk Seo, Shin Jaehoon, Sunatullo, Taewoong Eom, Yeachan Park, Yongseok Jang, Youchan Oh, Zhaoyang Wang, Zoltán Kovács
cs.AI
Résumé
Suite à la récente obtention de performances de niveau médaille d'or aux Olympiades Internationales de Mathématiques (OIM) par les LLMs de pointe, la communauté est à la recherche du prochain objectif significatif et ambitieux pour mesurer le raisonnement des LLMs. Alors que les problèmes de type olympiade ne mesurent que le raisonnement pas à pas, les problèmes de niveau recherche utilisent un tel raisonnement pour repousser les frontières de la connaissance mathématique elle-même, apparaissant ainsi comme une alternative prometteuse. Pourtant, les référentiels mathématiques de niveau recherche restent rares, car ces problèmes sont difficiles à obtenir (par exemple, Riemann Bench et FrontierMath-Tier 4 contiennent respectivement 25 et 50 problèmes). Afin de soutenir une évaluation fiable des modèles de pointe de nouvelle génération, nous présentons Soohak, un référentiel de 439 problèmes rédigés ex nihilo par 64 mathématiciens. Soohak comprend deux sous-ensembles. Sur le sous-ensemble Challenge, les modèles de pointe, dont Gemini-3-Pro, GPT-5 et Claude-Opus-4.5, atteignent respectivement 30,4 %, 26,4 % et 10,4 %, laissant une marge de progression substantielle, tandis que les principaux modèles à poids ouverts, tels que Qwen3-235B, GPT-OSS-120B et Kimi-2.5, restent sous les 15 %. Fait notable, au-delà de la résolution standard de problèmes, Soohak introduit un sous-ensemble Refus qui sonde une capacité intrinsèque aux mathématiques de recherche : reconnaître les problèmes mal posés et s'abstenir plutôt que de produire des réponses confiantes mais injustifiées. Sur ce sous-ensemble, aucun modèle ne dépasse les 50 %, ce qui fait du refus une nouvelle cible d'optimisation que les modèles actuels ne traitent pas directement. Afin de prévenir la contamination, l'ensemble de données sera rendu public fin 2026, les évaluations des modèles étant disponibles sur demande dans l'intervalle.
English
Following the recent achievement of gold-medal performance on the IMO by frontier LLMs, the community is searching for the next meaningful and challenging target for measuring LLM reasoning. Whereas olympiad-style problems measure step-by-step reasoning alone, research-level problems use such reasoning to advance the frontier of mathematical knowledge itself, emerging as a compelling alternative. Yet research-level math benchmarks remain scarce because such problems are difficult to source (e.g., Riemann Bench and FrontierMath-Tier 4 contain 25 and 50 problems, respectively). To support reliable evaluation of next-generation frontier models, we introduce Soohak, a 439-problem benchmark newly authored from scratch by 64 mathematicians. Soohak comprises two subsets. On the Challenge subset, frontier models including Gemini-3-Pro, GPT-5, and Claude-Opus-4.5 reach 30.4%, 26.4%, and 10.4% respectively, leaving substantial headroom, while leading open-weight models such as Qwen3-235B, GPT-OSS-120B, and Kimi-2.5 remain below 15%. Notably, beyond standard problem solving, Soohak introduces a refusal subset that probes a capability intrinsic to research mathematics: recognizing ill-posed problems and pausing rather than producing confident but unjustified answers. On this subset, no model exceeds 50%, identifying refusal as a new optimization target that current models do not directly address. To prevent contamination, the dataset will be publicly released in late 2026, with model evaluations available upon request in the interim.