MedPMC: Een systematisch raamwerk voor het opschalen van hoge-getrouwheid medische multimodale data voor fundamentmodellen
MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
July 8, 2026
Auteurs: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
cs.AI
Samenvatting
Geneeskunde is inherent multimodaal: clinici moeten informatie uit uiteenlopende datastromen synthetiseren. De ontwikkeling van multimodale funderingsmodellen wordt echter beperkt door beperkte toegang tot grootschalige, hoogwaardige klinische gegevens. Hoewel PubMed Central (PMC) een aanvullende bron biedt van door experts geschreven beeld-tekstgegevens, blijven bestaande uit PMC afgeleide bronnen beperkt in getrouwheid, reproduceerbaarheid en klinische validatie. We introduceren MedPMC, een geautomatiseerd, continu bijwerkbaar raamwerk dat permissief gelicentieerde literatuur omzet in een hoogwaardige infrastructuur voor medische multimodale modellen. Toegepast op 6,1 miljoen PMC-artikelen cureerde MedPMC 11 miljoen medische beeld-tekstparen. Componentevaluaties toonden sterke prestaties voor initiële screening (F1 = 93,2), detectie van figuren met meerdere panelen (F1 = 96,5), figuurscheiding (mAP = 89,8), bijschriftscheiding en -uitlijning (F1 = 81,4; ROUGE-L = 85,3) en classificatie van medische figuren (F1 = 96,5). Handmatige beoordeling door vijf annotatoren, van wie drie met medische opleiding, wees uit dat 95,3% van de MedPMC-beelden medisch relevant was, tegenover 19,7% in een eerdere uit PMC afgeleide dataset. Over 26 benchmarks verdeeld over 11 specialismen verbeterde een met MedPMC getraind CLIP-achtig model de gemiddelde nulmeting AUC met 7,1 procentpunt ten opzichte van de sterkste qua architectuur overeenkomende biomedische CLIP-baseline, ondanks dat het minder dan de helft van het aantal beeld-tekstparen gebruikte. Als visuele encoder in een multimodaal groot taalmodel verbeterde het de medische visuele vraagbeantwoording met respectievelijk 1,9 en 16,9 procentpunt over twee benchmarks. In 10.524 dermatologiefoto's van Yale New Haven Health System verbeterde het de morfologie-naar-beeldterugvinding Recall@5 met 11,7 procentpunt. Deze bevindingen tonen aan dat hoogwaardige literatuurcuratie medische multimodale funderingsmodellen versterkt, zowel in benchmark- als klinische omgevingen. We stellen het raamwerk, de corpus, benchmarks en voorgetrainde modellen openbaar beschikbaar.
English
Medicine is inherently multimodal, requiring clinicians to synthesize information across diverse data streams. Yet the development of multimodal foundation models is constrained by limited access to large-scale, high-quality clinical data. Although PubMed Central (PMC) offers a complementary source of expert-authored image-text data, existing PMC-derived resources remain limited in fidelity, reproducibility, and clinical validation. We introduce MedPMC, an automated, continuously updatable framework that transforms permissively licensed literature into high-fidelity infrastructure for medical multimodal models. Applied to 6.1 million PMC articles, MedPMC curated 11 million medical image-text pairs. Component evaluations showed strong performance for initial screening (F1 = 93.2), multi-panel figure detection (F1 = 96.5), figure separation (mAP = 89.8), caption separation and alignment (F1 = 81.4; ROUGE-L = 85.3), and medical figure classification (F1 = 96.5). Manual review by five annotators, three with medical training, found 95.3% of MedPMC images medically relevant, versus 19.7% in a prior PMC-derived dataset. Across 26 benchmarks spanning 11 specialties, a MedPMC-trained CLIP-style model improved average zero-shot AUC by 7.1 percentage points over the strongest architecture-matched biomedical CLIP baseline despite using fewer than half as many image-text pairs. As the vision encoder in a multimodal large language model, it improved medical visual question-answering by 1.9 and 16.9 percentage points across two benchmarks. In 10,524 Yale New Haven Health System dermatology photographs, it improved morphology-to-image retrieval Recall@5 by 11.7 percentage points. These findings show that high-fidelity literature curation strengthens medical multimodal foundation models across benchmark and clinical settings. We publicly release the framework, corpus, benchmarks, and pretrained models.