Pesquisa Profunda em Ciências Físicas: Um Arcabouço Multiagente e Benchmark Abrangente
Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark
June 17, 2026
Autores: Yigeng Jiang, Tengchao Yang, Taoyong Cui, Jiaxing Wan, Yuan Wang, Weida Wang, Zhiyu Liu, Chuyi Peng, Binzhao Luo, Maoli Gao, Huaihai Huang, Yuqianer Zeng, Ziyang Zheng, Dongchen Huang, Chao Chen, Zichao Liu, Weiping Shen, Shuchen Pu, Siyu Zhou, Runmin Ma, Yusong Hu, Fei Chao, Bo Zhang, Xiawu Zheng, Zifu Wang, Lei Bai, Yunqi Cai, Shufei Zhang
cs.AI
Resumo
Agentes de pesquisa profunda são sistemas baseados em Modelos de Linguagem de Grande Escala (LLM) projetados para raciocínio científico autônomo em múltiplas etapas, e possuem um imenso potencial para acelerar a pesquisa nas ciências físicas. No entanto, ainda faltam avaliações abrangentes e aprofundadas de suas capacidades nesse domínio. Para preencher essa lacuna, apresentamos o PhySciBench, um benchmark altamente relevante para a pesquisa em ciências físicas, composto por 200 questões selecionadas por especialistas, equilibradas entre física e química, abrangendo seis categorias de tarefas que refletem fluxos de trabalho científicos reais. Avaliações de modelos e sistemas de agentes do estado da arte no PhySciBench revelam desempenho limitado; mesmo a linha de base mais forte, o Gemini Deep Research, alcança uma precisão de apenas 33,5%. A análise dos casos de falha identifica três deficiências recorrentes: fragilidade em cadeias de raciocínio extensas, transferência limitada de conhecimento entre etapas e falta de autoverificação fundamentada na física. Motivados por essas descobertas, desenvolvemos o DelveAgent, um framework multiagente modular equipado com um loop de planejamento adaptativo, memória de dupla granularidade e um mecanismo de reflexão hierárquica fundamentada na física. Em quatro benchmarks científicos, o DelveAgent melhora a precisão em até 7,5 pontos percentuais, ao mesmo tempo que reduz os custos de inferência para aproximadamente um terço da linha de base mais forte. Esses resultados estabelecem a relevância do PhySciBench como um benchmark crítico para avaliar sistemas de IA nas ciências físicas e demonstram que a especialização arquitetural pode efetivamente aumentar a confiabilidade da pesquisa científica autônoma.
English
Deep research agents are Large Language Model (LLM)-based systems designed for autonomous, multi-step scientific reasoning, and they hold immense potential for accelerating research in the physical sciences. However, comprehensive and in-depth evaluations of their capabilities within this domain remain lacking. To address this gap, we introduce PhySciBench, a benchmark highly relevant to physical science research, comprising 200 expert-curated questions, balanced between physics and chemistry, across six task categories that reflect real-world scientific workflows. Evaluations of state-of-the-art models and agent systems on PhySciBench reveal limited performance; even the strongest baseline, Gemini Deep Research, achieves an accuracy of only 33.5%. Analysis of failure cases identifies three recurrent deficiencies: fragility in extended reasoning chains, limited knowledge transfer across steps, and a lack of physics-grounded self-verification. Motivated by these findings, we develop DelveAgent, a modular multi-agent framework equipped with an adaptive planning loop, dual-granularity memory, and a hierarchical physics-grounded reflection mechanism. Across four scientific benchmarks, DelveAgent improves accuracy by up to 7.5 percentage points while reducing inference costs to approximately one-third of the strongest baseline. These results establish the significance of PhySciBench as a critical benchmark for evaluating AI systems in the physical sciences and demonstrate that architectural specialization can effectively enhance the reliability of autonomous scientific research.