ChatPaper.aiChatPaper

PRL-Bench : Un benchmark complet évaluant les capacités des LLM dans la recherche en physique de pointe

PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

April 16, 2026
Auteurs: Tingjia Miao, Wenkai Jin, Muhua Zhang, Jinxin Tan, Yuelin Hu, Tu Guo, Jiejun Zhang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Weiqi Jiang, Yayun Hu, Zixing Lei, Xianghe Pang, Zexi Liu, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen
cs.AI

Résumé

Le paradigme de la science agentique exige que les systèmes d'IA effectuent des raisonnements robustes et s'engagent dans une exploration autonome à long terme. Cependant, les benchmarks scientifiques actuels se limitent à la compréhension des connaissances disciplinaires et au raisonnement complexe, sans évaluer la nature exploratoire et la complexité procédurale de la recherche réelle. Dans ce travail, nous présentons des évaluations orientées recherche en physique théorique et computationnelle, un banc d'essai naturel doté de connaissances disciplinaires complètes, d'un raisonnement complexe et de workflows vérifiables de bout en bout sans recours à l'expérimentation. Nous introduisons PRL-Bench (Physics Research by LLMs), un benchmark conçu pour cartographier systématiquement les limites des capacités des LLM à mener des recherches physiques de bout en bout. Construit à partir de 100 articles sélectionnés parmi les derniers numéros de Physical Review Letters depuis août 2025 et validé par des experts du domaine, PRL-Bench couvre cinq sous-domaines majeurs de la physique moderne intensifs en théorie et calcul : astrophysique, physique de la matière condensée, physique des hautes énergies, information quantique et physique statistique. Chaque tâche du benchmark est conçue pour reproduire les propriétés fondamentales de la recherche scientifique authentique, incluant une formulation orientée exploration, des workflows à long terme et une vérifiabilité objective, reconstituant ainsi les processus de raisonnement essentiels et les workflows de recherche de la physique réelle. L'évaluation des modèles de pointe montre que les performances restent limitées, avec le meilleur score global inférieur à 50, révélant un écart prononcé entre les capacités actuelles des LLM et les exigences de la recherche scientifique réelle. PRL-Bench constitue un banc d'essai fiable pour évaluer la prochaine génération de scientifiques IA et faire progresser les systèmes d'IA vers la découverte scientifique autonome.
English
The paradigm of agentic science requires AI systems to conduct robust reasoning and engage in long-horizon, autonomous exploration. However, current scientific benchmarks remain confined to domain knowledge comprehension and complex reasoning, failing to evaluate the exploratory nature and procedural complexity of real-world research. In this work, we present research-oriented evaluations in theoretical and computational physics, a natural testbed with comprehensive domain knowledge, complex reasoning, and verifiable end-to-end workflows without reliance on experiments. Here we introduce PRL-Bench (Physics Research by LLMs), a benchmark designed to systematically map the capability boundaries of LLMs in executing end-to-end physics research. Constructed from 100 curated papers from the latest issues of Physical Review Letters since August 2025 and validated by domain experts, PRL-Bench covers five major theory- and computation-intensive subfields of modern physics: astrophysics, condensed matter physics, high-energy physics, quantum information, and statistical physics. Each task in the benchmark is designed to replicate the core properties of authentic scientific research, including exploration-oriented formulation, long-horizon workflows, and objective verifiability, thereby reconstructing the essential reasoning processes and research workflows of real physics research. Evaluation across frontier models shows that performance remains limited, with the best overall score below 50, revealing a pronounced gap between current LLM capabilities and the demands of real scientific research. PRL-Bench serves a reliable testbed for accessing next generation AI scientists advancing AI systems toward autonomous scientific discovery.