MedPMC : un cadre systématique pour la mise à l'échelle de données médicales multimodales à haute fidélité pour les modèles fondamentaux
MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
July 8, 2026
Auteurs: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
cs.AI
Résumé
La médecine est intrinsèquement multimodale, obligeant les cliniciens à synthétiser des informations provenant de flux de données divers. Pourtant, le développement de modèles fondamentaux multimodaux est limité par l'accès restreint à des données cliniques à grande échelle et de haute qualité. Bien que PubMed Central (PMC) offre une source complémentaire de données textuelles et iconographiques rédigées par des experts, les ressources existantes issues de PMC restent limitées en termes de fidélité, de reproductibilité et de validation clinique. Nous présentons MedPMC, un cadre automatisé et actualisable en continu qui transforme la littérature sous licence permissive en une infrastructure haute-fidélité pour les modèles multimodaux médicaux. Appliqué à 6,1 millions d'articles PMC, MedPMC a permis de constituer 11 millions de paires image-texte médicales. Les évaluations des composants ont montré de bonnes performances pour le criblage initial (F1 = 93,2), la détection des figures multi-panneaux (F1 = 96,5), la séparation des figures (mAP = 89,8), la séparation et l'alignement des légendes (F1 = 81,4 ; ROUGE-L = 85,3) et la classification des figures médicales (F1 = 96,5). Une révision manuelle par cinq annotateurs, dont trois ayant une formation médicale, a révélé que 95,3 % des images MedPMC étaient médicalement pertinentes, contre 19,7 % dans un ensemble de données antérieur issu de PMC. Sur 26 bancs d'essai couvrant 11 spécialités, un modèle de type CLIP entraîné sur MedPMC a amélioré l'AUC moyenne en zéro-shot de 7,1 points de pourcentage par rapport à la référence biomédicale CLIP la plus forte avec une architecture comparable, malgré l'utilisation de moins de la moitié des paires image-texte. En tant qu'encodeur visuel dans un modèle de langage multimodal de grande taille, il a amélioré la réponse à des questions visuelles médicales de 1,9 et 16,9 points de pourcentage sur deux bancs d'essai. Sur 10 524 photographies dermatologiques du Yale New Haven Health System, il a amélioré le Rappel@5 pour la recherche morphologie-image de 11,7 points de pourcentage. Ces résultats montrent qu'un curation de littérature haute-fidélité renforce les modèles fondamentaux multimodaux médicaux, tant dans les contextes de bancs d'essai que cliniques. Nous publions le cadre, le corpus, les bancs d'essai et les modèles pré-entraînés.
English
Medicine is inherently multimodal, requiring clinicians to synthesize information across diverse data streams. Yet the development of multimodal foundation models is constrained by limited access to large-scale, high-quality clinical data. Although PubMed Central (PMC) offers a complementary source of expert-authored image-text data, existing PMC-derived resources remain limited in fidelity, reproducibility, and clinical validation. We introduce MedPMC, an automated, continuously updatable framework that transforms permissively licensed literature into high-fidelity infrastructure for medical multimodal models. Applied to 6.1 million PMC articles, MedPMC curated 11 million medical image-text pairs. Component evaluations showed strong performance for initial screening (F1 = 93.2), multi-panel figure detection (F1 = 96.5), figure separation (mAP = 89.8), caption separation and alignment (F1 = 81.4; ROUGE-L = 85.3), and medical figure classification (F1 = 96.5). Manual review by five annotators, three with medical training, found 95.3% of MedPMC images medically relevant, versus 19.7% in a prior PMC-derived dataset. Across 26 benchmarks spanning 11 specialties, a MedPMC-trained CLIP-style model improved average zero-shot AUC by 7.1 percentage points over the strongest architecture-matched biomedical CLIP baseline despite using fewer than half as many image-text pairs. As the vision encoder in a multimodal large language model, it improved medical visual question-answering by 1.9 and 16.9 percentage points across two benchmarks. In 10,524 Yale New Haven Health System dermatology photographs, it improved morphology-to-image retrieval Recall@5 by 11.7 percentage points. These findings show that high-fidelity literature curation strengthens medical multimodal foundation models across benchmark and clinical settings. We publicly release the framework, corpus, benchmarks, and pretrained models.