AtomiMed: Verificação Hierárquica de Fatos Atômicos para Avaliação Universal de Relatórios Médicos com Consciência Clínica
AtomiMed: Hierarchical Atomic Fact-Checking for Universal Clinical-Aware Medical Report Evaluation
June 30, 2026
Autores: Yuan Wang, Wanxing Chang, Songtao Jiang, Shujian Gao, Xiaotian Zhang, Ruifeng Yuan, Weiwei Cao, Bowen Shi, Ling Zhang, Zuozhu Liu, Jianpeng Zhang
cs.AI
Resumo
Métricas tradicionais para Geração de Relatórios Médicos (GRM) dependem predominantemente de sobreposição superficial de n-gramas, o que falha em capturar a precisão factual clínica e frequentemente negligencia erros diagnósticos catastróficos. Abordamos essa limitação fundamental propondo o AtomiMed, uma estrutura de avaliação universal e independente de modalidade que decompõe narrativas médicas complexas em uma hierarquia padronizada e multinível de Fatos Clínicos Atômicos, abrangendo entidades de nível de doença e descritores de nível de atributo, incluindo localização, morfologia e gravidade. Ao implementar um loop de Verificação Cruzada Agêntica entre relatórios de referência e previstos, o AtomiMed simula um processo de revisão por pares multi-radiologista para verificar a consistência clínica, permitindo assim a avaliação dissociada da detecção diagnóstica e da precisão descritiva. Para facilitar a avaliação padronizada, apresentamos o MRGEvalKit, um kit de ferramentas de código aberto para extração hierárquica automatizada, e curamos o OmniMRG-Bench, um benchmark multimodal abrangente que abrange Raios-X, TC, RM e Ultrassom. Experimentos extensos em múltiplos estudos de leitura anotados por especialistas demonstram que o AtomiMed alcança correlação significativamente maior com o julgamento de radiologistas humanos em comparação com métricas tradicionais e baseadas em modelos. Nosso código é disponibilizado em https://github.com/Venn2336/MRGEvalkit.
English
Traditional metrics for Medical Report Generation (MRG) predominantly rely on surface-level n-gram overlap, which fails to capture clinical factual accuracy and often overlooks catastrophic diagnostic errors. We address this fundamental limitation by proposing AtomiMed, a universal, modality-agnostic evaluation framework that decomposes complex medical narratives into a standardized, multi-level hierarchy of Atomic Clinical Facts, encompassing Disease-level entities and Attribute-level descriptors, including location, morphology, and severity. By implementing an Agentic Cross-Verification loop between ground-truth and predicted reports, AtomiMed simulates a multi-radiologist peer-review process to verify clinical consistency, thus enabling the decoupled assessment of diagnostic detection and descriptive accuracy. To facilitate standardized evaluation, we introduce MRGEvalKit, an open-source toolkit for automated hierarchical extraction, and curate OmniMRG-Bench, a comprehensive multi-modal benchmark covering X-ray, CT, MRI, and Ultrasound. Extensive experiments on multiple expert-annotated reader studies demonstrate that AtomiMed achieves significantly higher correlation with human radiologist judgment compared to traditional and model-based metrics. Our code are release at https://github.com/Venn2336/MRGEvalkit