ChatPaper.aiChatPaper

AtomiMed: Hiërarchische Atomaire Feitencontrole voor Universele Klinisch-Bewuste Evaluatie van Medische Rapporten

AtomiMed: Hierarchical Atomic Fact-Checking for Universal Clinical-Aware Medical Report Evaluation

June 30, 2026
Auteurs: Yuan Wang, Wanxing Chang, Songtao Jiang, Shujian Gao, Xiaotian Zhang, Ruifeng Yuan, Weiwei Cao, Bowen Shi, Ling Zhang, Zuozhu Liu, Jianpeng Zhang
cs.AI

Samenvatting

Traditionele metrieken voor Medische Verslaggeneratie (MRG) zijn voornamelijk gebaseerd op oppervlakkige n-gram overlap, die er niet in slagen klinische feitelijke nauwkeurigheid vast te leggen en vaak catastrofale diagnostische fouten over het hoofd zien. We pakken deze fundamentele beperking aan door AtomiMed voor te stellen, een universeel, modaliteitsonafhankelijk evaluatiekader dat complexe medische narratieven ontleedt in een gestandaardiseerde, meerlagige hiërarchie van Atomaire Klinische Feiten, waaronder entiteiten op ziektniveau en beschrijvingen op attribuutniveau zoals locatie, morfologie en ernst. Door implementatie van een Agentische Kruisverificatielus tussen grondwaarheid en voorspelde verslagen simuleert AtomiMed een peer-reviewproces met meerdere radiologen om klinische consistentie te verifiëren, wat een ontkoppelde beoordeling van diagnostische detectie en beschrijvende nauwkeurigheid mogelijk maakt. Om gestandaardiseerde evaluatie te faciliteren introduceren we MRGEvalKit, een open-source toolkit voor geautomatiseerde hiërarchische extractie, en stellen we OmniMRG-Bench samen, een uitgebreide multimodale benchmark die röntgen, CT, MRI en echografie omvat. Uitgebreide experimenten op meerdere door experts geannoteerde beoordelingsstudies tonen aan dat AtomiMed een significant hogere correlatie bereikt met het oordeel van menselijke radiologen in vergelijking met traditionele en modelgebaseerde metrieken. Onze code is beschikbaar op https://github.com/Venn2336/MRGEvalkit.
English
Traditional metrics for Medical Report Generation (MRG) predominantly rely on surface-level n-gram overlap, which fails to capture clinical factual accuracy and often overlooks catastrophic diagnostic errors. We address this fundamental limitation by proposing AtomiMed, a universal, modality-agnostic evaluation framework that decomposes complex medical narratives into a standardized, multi-level hierarchy of Atomic Clinical Facts, encompassing Disease-level entities and Attribute-level descriptors, including location, morphology, and severity. By implementing an Agentic Cross-Verification loop between ground-truth and predicted reports, AtomiMed simulates a multi-radiologist peer-review process to verify clinical consistency, thus enabling the decoupled assessment of diagnostic detection and descriptive accuracy. To facilitate standardized evaluation, we introduce MRGEvalKit, an open-source toolkit for automated hierarchical extraction, and curate OmniMRG-Bench, a comprehensive multi-modal benchmark covering X-ray, CT, MRI, and Ultrasound. Extensive experiments on multiple expert-annotated reader studies demonstrate that AtomiMed achieves significantly higher correlation with human radiologist judgment compared to traditional and model-based metrics. Our code are release at https://github.com/Venn2336/MRGEvalkit