Évaluation des grands modèles de langage dans la prise de décision clinique dynamique à l'aide de cas de patients standardisés
Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases
June 3, 2026
Auteurs: Cheng Liang, Pengcheng Qiu, Ya Zhang, Yanfeng Wang, Chaoyi Wu, Weidi Xie
cs.AI
Résumé
Les grands modèles de langage (GMLs) sont de plus en plus proposés comme agents cliniques, mais des benchmarks statiques à un seul tour ne peuvent pas capturer la manière dont un modèle prodigue des soins de manière dynamique tout au long d'une consultation : recueillir des informations, planifier un traitement et adapter la prise en charge longitudinale en fonction des états successifs du patient. La formation médicale aborde depuis longtemps un défi analogue grâce aux patients standardisés (PS) : des acteurs entraînés qui incarnent de manière cohérente des cas cliniques, permettant une pratique réaliste et une évaluation objective et scénarisée. Nous présentons ici MedSP1000, un benchmark interactif dérivé des PS pour l'évaluation des agents cliniques, comprenant 1 638 cas PS avec 24 602 grilles d'évaluation au niveau de la trajectoire validées par des pairs. MedSP1000 convertit des cas pédagogiques PS évalués par les pairs en scénarios exécutables avec des scripts de cas PS définis, des contextes d'environnement clinique et une grille d'évaluation structurée validée par des humains. Dans chaque cycle d'évaluation par simulation, un agent clinique interagit en boucle fermée avec un agent patient et un contrôleur d'environnement, et son comportement est noté tout au long de la consultation selon des critères experts spécifiés dans les documents originaux. En appliquant MedSP1000 à une gamme de GMLs généralistes et spécialisés en médecine, nous constatons que les performances sur des benchmarks statiques ne se traduisent pas de manière fiable à de tels scénarios pédagogiques. Le modèle le plus performant, GPT-5.5, n'achève que 60,4 % des items de la grille d'évaluation définie par les experts, tandis que le modèle médical spécialisé le plus fort atteint 40,0 % ; augmenter le temps de calcul lors du test ne produit aucun gain mesurable. Ces résultats suggèrent que les GMLs actuels, y compris les systèmes agentiques optimisés pour la médecine, ne sont pas encore suffisamment fiables pour être intégrés en toute sécurité dans la pratique clinique réelle. Plus largement, MedSP1000 montre comment une évaluation de type processus, à la manière des PS, peut révéler des modes de défaillance cliniquement pertinents que les benchmarks à un seul tour ne détectent pas.
English
Large language models (LLMs) are increasingly proposed as clinical agents, yet static, single-turn benchmarks cannot capture how a model dynamically delivers care across an encounter: gathering information, planning treatment, and adapting longitudinal management across successive patient states. Medical education has long addressed an analogous challenge through standardized patients (SPs): trained actors who consistently portray clinical cases, enabling realistic practice and objective, scripted assessment. Here we introduce MedSP1000, an SP-derived interactive benchmark for clinical-agent evaluation, including 1,638 SP cases with 24,602 trajectory-level peer-reviewed rubrics. MedSP1000 converts peer-reviewed SP teaching cases into executable scenarios with defined SP case scripts, clinical environment contexts, and human-validated structured rubric. In each simulation evaluation run, a clinical agent interacts in closed loop with a patient agent and an environment controller, and its behaviour is scored throughout the encounter against expert criteria specified in the original materials. Applying MedSP1000 to a range of general-purpose and medically specialized LLMs, we find that performance on static benchmarks does not reliably translate to such educational scenarios. The best-performing model, GPT-5.5, completes only 60.4% of expert-defined rubric items, whereas the strongest medically specialized model reaches 40.0%; increasing test-time compute produces no measurable gain. These results suggest that current LLMs, including agentic systems tuned for medicine, are not yet reliable enough to be safely integrated into actual clinical practice. More broadly, MedSP1000 shows how process-level, SP-style evaluation can reveal clinically relevant failure modes that single-turn benchmarks miss.