ChatPaper.aiChatPaper

HealthAgentBench: Uma Suíte de Benchmark Unificada de Ambientes de Saúde Agênticos Realistas para Agentes de IA de Fronteira Desafiadores

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

June 30, 2026
Autores: Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon
cs.AI

Resumo

À medida que os agentes de IA se tornam cada vez mais capazes de realizar raciocínios complexos e de longo horizonte, uma avaliação rigorosa e holística é essencial para medir o progresso em direção a aplicações reais na área da saúde. Apresentamos o HealthAgentBench, um conjunto de 54 tarefas agênticas de saúde, distribuídas em 7 categorias, cada uma com seu ambiente único. O conjunto de benchmarks abrange diversos fluxos de trabalho ao longo da jornada do paciente e uma ampla gama de modalidades. Cada tarefa é projetada para replicar um fluxo de trabalho clínico completo: com instruções mínimas, um agente deve explorar dados brutos de saúde, operar em um ambiente complexo e executar soluções de múltiplas etapas que vão além da simples inicialização por prompt. Uma taxa de sucesso final das tarefas é relatada para fornecer uma métrica única e interpretável para o desempenho geral do HealthAgentBench para cada agente. Ao avaliar agentes de ponta no HealthAgentBench, constatamos que a taxa geral de sucesso das tarefas permanece baixa, destacando a dificuldade do conjunto. O agente mais forte e mais econômico, Codex GPT-5.5, alcança apenas aproximadamente 42% de taxa de sucesso. Além do desempenho agregado, o HealthAgentBench revela pontos fortes e fracos específicos em todas as categorias de tarefas. Agentes de ponta mostram potencial no desenvolvimento automático de pipelines de modelagem de pesquisa sobre dados de EHR, mas a imagem médica continua particularmente desafiadora, especialmente para os modelos Claude Code, enquanto o Codex GPT-5.5 mostra capacidade emergente. Tarefas que combinam grandes espaços de busca com requisitos de raciocínio composicional permanecem difíceis para todos os agentes atuais. Em conjunto, esses resultados sugerem que o HealthAgentBench fornece um benchmark desafiador e realista, com espaço substancial para progresso futuro. Disponibilizamos nosso benchmark em https://github.com/microsoft/HealthAgentBench.
English
As AI agents become increasingly capable of complex, long-horizon reasoning, rigorous and holistic evaluation is essential for measuring progress toward real-world healthcare applications. We introduce HealthAgentBench, a suite of 54 agentic healthcare tasks across 7 categories each with its unique environment. The benchmark suite spans diverse workflows throughout the patient journey and a broad range of modalities. Each task is designed to replicate an end-to-end clinical workflow: given minimal instructions, an agent must explore raw healthcare data, operate within a complex environment, and execute multi-step solutions that go beyond naive prompting. A final task success rate is reported to provide a single, interpretable metric for HealthAgentBench overall performance for each agent. Evaluating frontier agents on HealthAgentBench, we find that overall task success rate remains low, underscoring the difficulty of the suite. The strongest and the most cost effective agent, Codex GPT-5.5, achieves only approximately 42% success rate. Beyond aggregate performance, HealthAgentBench reveals nuanced strengths and weaknesses across task categories. Frontier agents show promise in automatically developing research modeling pipelines over EHR data, but medical imaging remains especially challenging, particularly for Claude Code models, while Codex GPT-5.5 shows emerging capability. Tasks that combine large search spaces with compositional reasoning requirements remain difficult for all current agents. Together, these results suggest that HealthAgentBench provides a challenging and realistic benchmark with substantial room for future progress. We release our benchmark at https://github.com/microsoft/HealthAgentBench.