Soohak: Um Benchmark Curado por Matemáticos para Avaliar Capacidades Matemáticas de Nível de Pesquisa de LLMs
Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs
May 9, 2026
Autores: Guijin Son, Seungone Kim, Catherine Arnett, Hyunwoo Ko, Hyein Lee, Hyeonah Kang, Jiang Longxi, Jin Yun, JungYup Lee, Kyungmin Lee, Sam Yoosuk Kim, Sang Park, Seunghyeok Hong, SeungJae Lee, Seungyeop Yi, Shinae Shin, SunHye Bok, Sunyoung Shin, Yonghoon Ji, Youngtaek Kim, Hanearl Jung, Akari Asai, Graham Neubig, Sean Welleck, Youngjae Yu, Akshelin R, Alexander B. Ivanov, Boboev Muhammadjon, Chaeyoung Han, Christian Stump, Dmitrii Karp, Dohyun Kwon, DoYong Kwon, Duk-Soon Oh, Giovanni Resta, Greta Panova, Huiyun Noh, Hyungryul Baik, Hyungsun Bae, Inomov Mashrafdzhon, Jeewon Kim, Ji Eun Lee, Jiaqi Liu, Jieui Kang, Jimin Kim, Jon-Lark Kim, Junseo Yoon, Junwoo Jo, Kibeom Kim, Kiwoon Kwon, Mario Kummer, Max Mercer, Minjun Kim, Nahyun Lee, Ng Ze-An, Rafał Marcin Łochowski, Raphaël Lachièze-Rey, Ruichen Zhang, Sejin Park, Seonguk Seo, Shin Jaehoon, Sunatullo, Taewoong Eom, Yeachan Park, Yongseok Jang, Youchan Oh, Zhaoyang Wang, Zoltán Kovács
cs.AI
Resumo
Após a recente conquista de desempenho no nível de medalha de ouro na IMO por modelos de linguagem de fronteira (LLMs), a comunidade busca o próximo alvo significativo e desafiador para medir o raciocínio de LLMs. Enquanto problemas no estilo olímpico medem apenas o raciocínio passo a passo, problemas em nível de pesquisa utilizam esse raciocínio para avançar a própria fronteira do conhecimento matemático, emergindo como uma alternativa convincente. No entanto, benchmarks matemáticos em nível de pesquisa ainda são escassos, pois tais problemas são difíceis de obter (por exemplo, Riemann Bench e FrontierMath-Tier 4 contêm 25 e 50 problemas, respectivamente). Para apoiar uma avaliação confiável de modelos de fronteira de próxima geração, apresentamos Soohak, um benchmark de 439 problemas, criado do zero por 64 matemáticos. Soohak compreende dois subconjuntos. No subconjunto Challenge, modelos de fronteira como Gemini-3-Pro, GPT-5 e Claude-Opus-4.5 alcançam 30,4%, 26,4% e 10,4%, respectivamente, deixando espaço substancial para melhoria, enquanto modelos de peso aberto líderes como Qwen3-235B, GPT-OSS-120B e Kimi-2.5 permanecem abaixo de 15%. Notavelmente, além da resolução padrão de problemas, Soohak introduz um subconjunto de recusa que investiga uma capacidade intrínseca à matemática de pesquisa: reconhecer problemas mal colocados e pausar, em vez de produzir respostas confiantes, mas injustificadas. Nesse subconjunto, nenhum modelo ultrapassa 50%, identificando a recusa como um novo alvo de otimização que os modelos atuais não abordam diretamente. Para evitar contaminação, o conjunto de dados será divulgado publicamente no final de 2026, com avaliações de modelo disponíveis mediante solicitação nesse ínterim.
English
Following the recent achievement of gold-medal performance on the IMO by frontier LLMs, the community is searching for the next meaningful and challenging target for measuring LLM reasoning. Whereas olympiad-style problems measure step-by-step reasoning alone, research-level problems use such reasoning to advance the frontier of mathematical knowledge itself, emerging as a compelling alternative. Yet research-level math benchmarks remain scarce because such problems are difficult to source (e.g., Riemann Bench and FrontierMath-Tier 4 contain 25 and 50 problems, respectively). To support reliable evaluation of next-generation frontier models, we introduce Soohak, a 439-problem benchmark newly authored from scratch by 64 mathematicians. Soohak comprises two subsets. On the Challenge subset, frontier models including Gemini-3-Pro, GPT-5, and Claude-Opus-4.5 reach 30.4%, 26.4%, and 10.4% respectively, leaving substantial headroom, while leading open-weight models such as Qwen3-235B, GPT-OSS-120B, and Kimi-2.5 remain below 15%. Notably, beyond standard problem solving, Soohak introduces a refusal subset that probes a capability intrinsic to research mathematics: recognizing ill-posed problems and pausing rather than producing confident but unjustified answers. On this subset, no model exceeds 50%, identifying refusal as a new optimization target that current models do not directly address. To prevent contamination, the dataset will be publicly released in late 2026, with model evaluations available upon request in the interim.