ChatPaper.aiChatPaper

RealICU : Les agents LLM comprennent-ils les données de l'ICU en contexte long ? Un benchmark au-delà de l'imitation comportementale

RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation

May 13, 2026
Auteurs: Chengzhi Shen, Weixiang Shen, Tobias Susetzky, Chen, Chen, Jun Li, Yuyuan Liu, Xuepeng Zhang, Zhenyu Gong, Daniel Rueckert, Jiazhen Pan
cs.AI

Résumé

Les unités de soins intensifs (USI) génèrent des flux d'informations cliniques longs, denses et évolutifs, où les médecins doivent réévaluer à plusieurs reprises l'état des patients sous contrainte de temps, soulignant un besoin évident d'un système décisionnel fiable basé sur l'intelligence artificielle. Les bancs d'essai existants pour les USI considèrent généralement les actions cliniques historiques comme une vérité terrain. Cependant, ces actions sont réalisées avec des informations incomplètes et un contexte temporel limité de l'état sous-jacent du patient, et peuvent donc être sous-optimales, ce qui rend difficile l'évaluation des véritables capacités de raisonnement des systèmes d'IA. Nous présentons RealICU, un banc d'essai annoté rétrospectivement pour évaluer les grands modèles de langage (LLM) dans des conditions réalistes d'USI, où les étiquettes sont créées après que des médecins seniors ont examiné l'intégralité de la trajectoire du patient. Nous formulons quatre tâches motivées par les médecins : évaluer l'état du patient, les problèmes aigus, les actions recommandées et les actions "drapeau rouge" qui risquent d'entraîner des résultats dangereux. Nous partitionnons chaque trajectoire par fenêtres de 30 minutes et publions deux ensembles de données : RealICU-Gold avec 930 annotations de fenêtres provenant de 94 patients MIMIC-IV, et RealICU-Scale avec 11 862 fenêtres étendues via Oracle, un étiqueteur LLM rétrospectif validé par des médecins. Les LLM existants, y compris ceux à mémoire augmentée, obtiennent de mauvais résultats sur RealICU, exposant deux modes d'échec : un compromis rappel-sécurité pour les recommandations cliniques, et un biais d'ancrage aux premières interprétations du patient. Nous introduisons en outre ICU-Evo pour étudier les agents à mémoire structurée, qui améliore le raisonnement à long terme mais n'élimine pas complètement les échecs de sécurité. Ensemble, RealICU fournit un banc d'essai cliniquement fondé pour mesurer et améliorer le soutien décisionnel séquentiel de l'IA dans les soins à haut risque. Page du projet : https://chengzhi-leo.github.io/RealICU-Bench/
English
Intensive care units (ICU) generate long, dense and evolving streams of clinical information, where physicians must repeatedly reassess patient states under time pressure, underscoring a clear need for reliable AI decision support. Existing ICU benchmarks typically treat historical clinician actions as ground truth. However, these actions are made under incomplete information and limited temporal context of the underlying patient state, and may therefore be suboptimal, making it difficult to assess the true reasoning capabilities of AI systems. We introduce RealICU, a hindsight-annotated benchmark for evaluating large language models (LLMs) under realistic ICU conditions, where labels are created after senior physicians review the full patient trajectory. We formulate four physician-motivated tasks: assess Patient Status, Acute Problems, Recommended Actions, and Red Flag actions that risk unsafe outcomes. We partition each trajectory with 30-min windows and release two datasets: RealICU-Gold with 930-window annotations from 94 MIMIC-IV patients, and RealICU-Scale with 11,862 windows extended by Oracle, a physician-validated LLM hindsight labeler. Existing LLMs including memory-augmented ones performed poorly on RealICU, exposing two failure modes: a recall-safety tradeoff for clinical recommendations, and an anchoring bias to early interpretations of the patient. We further introduce ICU-Evo to study structured-memory agents that improves long-horizon reasoning but does not fully eliminate safety failures. Together, RealICU provides a clinically grounded testbed for measuring and improving AI sequential decision-support in high-stakes care. Project page: https://chengzhi-leo.github.io/RealICU-Bench/