ChatPaper.aiChatPaper

PhysicianBench: Avaliação de Agentes de LLM em Ambientes de Prontuário Eletrônico do Paciente do Mundo Real

PhysicianBench: Evaluating LLM Agents in Real-World EHR Environments

May 4, 2026
Autores: Ruoqi Liu, Imran Q. Mohiuddin, Austin J. Schoeffler, Kavita Renduchintala, Ashwin Nayak, Prasantha L. Vemu, Shivam C. Vedak, Kameron C. Black, John L. Havlik, Isaac Ogunmola, Stephen P. Ma, Roopa Dhatt, Jonathan H. Chen
cs.AI

Resumo

Apresentamos o PhysicianBench, um benchmark para avaliação de agentes de LLM em tarefas médicas fundamentadas em ambientes clínicos reais dentro de ambientes de prontuário eletrônico de saúde (EHR). Os benchmarks médicos existentes para agentes concentram-se principalmente na recuperação de conhecimento estático, em ações atômicas de etapa única ou na intenção de ação sem verificação executável contra o ambiente. Como resultado, eles não conseguem capturar os fluxos de trabalho compostos e de longo horizonte que caracterizam os sistemas clínicos reais. O PhysicianBench compreende 100 tarefas de longo horizonte adaptadas de casos de consulta reais entre médicos de atenção primária e subespecialistas, com cada tarefa revisada independentemente por um painel separado de médicos. As tarefas são instanciadas em um ambiente EHR com registros de pacientes reais e acessadas através das mesmas APIs padrão utilizadas por fornecedores comerciais de EHR. As tarefas abrangem 21 especialidades (por exemplo, cardiologia, endocrinologia, oncologia, psiquiatria) e diversos tipos de fluxo de trabalho (por exemplo, interpretação de diagnóstico, prescrição de medicamentos, planejamento de tratamento), exigindo uma média de 27 chamadas de ferramenta por tarefa. Resolver cada tarefa requer a recuperação de dados entre atendimentos, o raciocínio sobre informações clínicas heterogêneas, a execução de ações clínicas consequentes e a produção de documentação clínica. Cada tarefa é decomposta em pontos de verificação estruturados (670 no total em todo o benchmark) que capturam estágios distintos de conclusão, classificados por scripts específicos da tarefa com verificação fundamentada na execução. Entre 13 agentes de LLM proprietários e de código aberto, o modelo de melhor desempenho atinge apenas 46% de taxa de sucesso (pass@1), enquanto os modelos de código aberto alcançam no máximo 19%, revelando uma lacuna substancial entre as capacidades atuais dos agentes e as demandas dos fluxos de trabalho clínicos do mundo real. O PhysicianBench fornece um benchmark realista e fundamentado na execução para medir o progresso em direção a agentes clínicos autônomos.
English
We introduce PhysicianBench, a benchmark for evaluating LLM agents on physician tasks grounded in real clinical setting within electronic health record (EHR) environments. Existing medical agent benchmarks primarily focus on static knowledge recall, single-step atomic actions, or action intent without verifiable execution against the environment. As a result, they fail to capture the long-horizon, composite workflows that characterize real clinical systems. PhysicianBench comprises 100 long-horizon tasks adapted from real consultation cases between primary care and subspecialty physicians, with each task independently reviewed by a separate panel of physicians. Tasks are instantiated in an EHR environment with real patient records and accessed through the same standard APIs used by commercial EHR vendors. Tasks span 21 specialties (e.g., cardiology, endocrinology, oncology, psychiatry) and diverse workflow types (e.g., diagnosis interpretation, medication prescribing, treatment planning), requiring an average of 27 tool calls per task. Solving each task requires retrieving data across encounters, reasoning over heterogeneous clinical information, executing consequential clinical actions, and producing clinical documentation. Each task is decomposed into structured checkpoints (670 in total across the benchmark) capturing distinct stages of completion graded by task-specific scripts with execution-grounded verification. Across 13 proprietary and open-source LLM agents, the best-performing model achieves only 46% success rate (pass@1), while open-source models reach at most 19%, revealing a substantial gap between current agent capabilities and the demands of real-world clinical workflows. PhysicianBench provides a realistic and execution-grounded benchmark for measuring progress toward autonomous clinical agents.