ChatPaper.aiChatPaper

Soohak: Een door wiskundigen samengestelde benchmark voor het evalueren van wiskundige capaciteiten op onderzoeksniveau van LLMs

Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs

May 9, 2026
Auteurs: Guijin Son, Seungone Kim, Catherine Arnett, Hyunwoo Ko, Hyein Lee, Hyeonah Kang, Jiang Longxi, Jin Yun, JungYup Lee, Kyungmin Lee, Sam Yoosuk Kim, Sang Park, Seunghyeok Hong, SeungJae Lee, Seungyeop Yi, Shinae Shin, SunHye Bok, Sunyoung Shin, Yonghoon Ji, Youngtaek Kim, Hanearl Jung, Akari Asai, Graham Neubig, Sean Welleck, Youngjae Yu, Akshelin R, Alexander B. Ivanov, Boboev Muhammadjon, Chaeyoung Han, Christian Stump, Dmitrii Karp, Dohyun Kwon, DoYong Kwon, Duk-Soon Oh, Giovanni Resta, Greta Panova, Huiyun Noh, Hyungryul Baik, Hyungsun Bae, Inomov Mashrafdzhon, Jeewon Kim, Ji Eun Lee, Jiaqi Liu, Jieui Kang, Jimin Kim, Jon-Lark Kim, Junseo Yoon, Junwoo Jo, Kibeom Kim, Kiwoon Kwon, Mario Kummer, Max Mercer, Minjun Kim, Nahyun Lee, Ng Ze-An, Rafał Marcin Łochowski, Raphaël Lachièze-Rey, Ruichen Zhang, Sejin Park, Seonguk Seo, Shin Jaehoon, Sunatullo, Taewoong Eom, Yeachan Park, Yongseok Jang, Youchan Oh, Zhaoyang Wang, Zoltán Kovács
cs.AI

Samenvatting

Na de recente prestatie van geavanceerde LLM's waarbij ze goudmedailleprestaties op de IMO behaalden, is de gemeenschap op zoek naar de volgende betekenisvolle en uitdagende doelstelling voor het meten van het redeneervermogen van LLM's. Terwijl olympiade-achtige problemen alleen stapsgewijze redenering meten, gebruiken problemen op onderzoeksniveau dergelijke redenering om de grens van wiskundige kennis zelf te verleggen, wat een aantrekkelijk alternatief biedt. Toch blijven benchmarks voor wiskunde op onderzoeksniveau schaars, omdat dergelijke problemen moeilijk te verkrijgen zijn (bijv. Riemann Bench en FrontierMath-Tier 4 bevatten respectievelijk 25 en 50 problemen). Om een betrouwbare evaluatie van de volgende generatie geavanceerde modellen te ondersteunen, introduceren we Soohak, een benchmark van 439 problemen die opnieuw vanaf de basis is opgesteld door 64 wiskundigen. Soohak bestaat uit twee deelverzamelingen. Op de Challenge-deelverzameling bereiken geavanceerde modellen zoals Gemini-3-Pro, GPT-5 en Claude-Opus-4.5 respectievelijk 30,4%, 26,4% en 10,4%, wat aanzienlijke ruimte voor verbetering overlaat, terwijl toonaangevende modellen met open gewichten zoals Qwen3-235B, GPT-OSS-120B en Kimi-2.5 onder de 15% blijven. Opmerkelijk is dat Soohak, naast standaard probleemoplossing, een weigeringsdeelverzameling introduceert die een vaardigheid onderzoekt die inherent is aan onderzoekswiskunde: het herkennen van slecht gestelde problemen en stoppen in plaats van zelfverzekerde maar ongefundeerde antwoorden geven. Op deze deelverzameling overschrijdt geen enkel model de 50%, wat weigering identificeert als een nieuw optimalisatiedoel waar huidige modellen niet direct op inspelen. Om contaminatie te voorkomen, wordt de dataset eind 2026 openbaar gemaakt, met tussentijds op verzoek beschikbare modelevaluaties.
English
Following the recent achievement of gold-medal performance on the IMO by frontier LLMs, the community is searching for the next meaningful and challenging target for measuring LLM reasoning. Whereas olympiad-style problems measure step-by-step reasoning alone, research-level problems use such reasoning to advance the frontier of mathematical knowledge itself, emerging as a compelling alternative. Yet research-level math benchmarks remain scarce because such problems are difficult to source (e.g., Riemann Bench and FrontierMath-Tier 4 contain 25 and 50 problems, respectively). To support reliable evaluation of next-generation frontier models, we introduce Soohak, a 439-problem benchmark newly authored from scratch by 64 mathematicians. Soohak comprises two subsets. On the Challenge subset, frontier models including Gemini-3-Pro, GPT-5, and Claude-Opus-4.5 reach 30.4%, 26.4%, and 10.4% respectively, leaving substantial headroom, while leading open-weight models such as Qwen3-235B, GPT-OSS-120B, and Kimi-2.5 remain below 15%. Notably, beyond standard problem solving, Soohak introduces a refusal subset that probes a capability intrinsic to research mathematics: recognizing ill-posed problems and pausing rather than producing confident but unjustified answers. On this subset, no model exceeds 50%, identifying refusal as a new optimization target that current models do not directly address. To prevent contamination, the dataset will be publicly released in late 2026, with model evaluations available upon request in the interim.