ChatPaper.aiChatPaper

MedPMC: Uma Estrutura Sistemática para Ampliação de Dados Multimodais Médicos de Alta Fidelidade para Modelos Fundamentais

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

July 8, 2026
Autores: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
cs.AI

Resumo

A medicina é inerentemente multimodal, exigindo que os clínicos sintetizem informações de diversas fontes de dados. No entanto, o desenvolvimento de modelos fundamentais multimodais é limitado pelo acesso restrito a dados clínicos em grande escala e alta qualidade. Embora o PubMed Central (PMC) ofereça uma fonte complementar de dados de imagem-texto elaborados por especialistas, os recursos existentes derivados do PMC permanecem limitados em fidelidade, reprodutibilidade e validação clínica. Apresentamos o MedPMC, uma estrutura automatizada e continuamente atualizável que transforma literatura com licença permissiva em infraestrutura de alta fidelidade para modelos multimodais médicos. Aplicado a 6,1 milhões de artigos do PMC, o MedPMC selecionou 11 milhões de pares imagem-texto médicos. Avaliações de componentes mostraram desempenho robusto para triagem inicial (F1 = 93,2), detecção de figuras em múltiplos painéis (F1 = 96,5), separação de figuras (mAP = 89,8), separação e alinhamento de legendas (F1 = 81,4; ROUGE-L = 85,3) e classificação de figuras médicas (F1 = 96,5). A revisão manual por cinco anotadores, três com formação médica, constatou que 95,3% das imagens do MedPMC eram clinicamente relevantes, contra 19,7% em um conjunto de dados anterior derivado do PMC. Em 26 referências (benchmarks) abrangendo 11 especialidades, um modelo no estilo CLIP treinado com o MedPMC melhorou a AUC média zero-shot em 7,1 pontos percentuais em relação à linha de base CLIP biomédica mais forte com arquitetura correspondente, apesar de usar menos da metade dos pares imagem-texto. Como codificador visual em um modelo de linguagem grande multimodal, ele melhorou o questionamento visual médico em 1,9 e 16,9 pontos percentuais em duas referências. Em 10.524 fotografias dermatológicas do Yale New Haven Health System, melhorou o Recall@5 da recuperação morfologia-para-imagem em 11,7 pontos percentuais. Esses achados mostram que a curadoria de literatura de alta fidelidade fortalece modelos fundamentais multimodais médicos tanto em ambientes de referência quanto clínicos. Disponibilizamos publicamente a estrutura, o corpus, as referências e os modelos pré-treinados.
English
Medicine is inherently multimodal, requiring clinicians to synthesize information across diverse data streams. Yet the development of multimodal foundation models is constrained by limited access to large-scale, high-quality clinical data. Although PubMed Central (PMC) offers a complementary source of expert-authored image-text data, existing PMC-derived resources remain limited in fidelity, reproducibility, and clinical validation. We introduce MedPMC, an automated, continuously updatable framework that transforms permissively licensed literature into high-fidelity infrastructure for medical multimodal models. Applied to 6.1 million PMC articles, MedPMC curated 11 million medical image-text pairs. Component evaluations showed strong performance for initial screening (F1 = 93.2), multi-panel figure detection (F1 = 96.5), figure separation (mAP = 89.8), caption separation and alignment (F1 = 81.4; ROUGE-L = 85.3), and medical figure classification (F1 = 96.5). Manual review by five annotators, three with medical training, found 95.3% of MedPMC images medically relevant, versus 19.7% in a prior PMC-derived dataset. Across 26 benchmarks spanning 11 specialties, a MedPMC-trained CLIP-style model improved average zero-shot AUC by 7.1 percentage points over the strongest architecture-matched biomedical CLIP baseline despite using fewer than half as many image-text pairs. As the vision encoder in a multimodal large language model, it improved medical visual question-answering by 1.9 and 16.9 percentage points across two benchmarks. In 10,524 Yale New Haven Health System dermatology photographs, it improved morphology-to-image retrieval Recall@5 by 11.7 percentage points. These findings show that high-fidelity literature curation strengthens medical multimodal foundation models across benchmark and clinical settings. We publicly release the framework, corpus, benchmarks, and pretrained models.