ChatPaper.aiChatPaper

MedPMC: Un marco sistemático para escalar datos multimodales médicos de alta fidelidad para modelos fundacionales

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

July 8, 2026
Autores: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
cs.AI

Resumen

La medicina es inherentemente multimodal, lo que requiere que los clínicos sinteticen información proveniente de diversos flujos de datos. Sin embargo, el desarrollo de modelos fundacionales multimodales está limitado por el acceso restringido a datos clínicos de gran escala y alta calidad. Aunque PubMed Central (PMC) ofrece una fuente complementaria de datos de imagen-texto redactados por expertos, los recursos existentes derivados de PMC siguen siendo limitados en fidelidad, reproducibilidad y validación clínica. Presentamos MedPMC, un marco automatizado y actualizable continuamente que transforma literatura con licencia permisiva en infraestructura de alta fidelidad para modelos multimodales médicos. Aplicado a 6.1 millones de artículos de PMC, MedPMC seleccionó 11 millones de pares de imagen-texto médicos. Las evaluaciones de componentes mostraron un rendimiento sólido en la selección inicial (F1 = 93.2), la detección de figuras multipanel (F1 = 96.5), la separación de figuras (mAP = 89.8), la separación y alineación de leyendas (F1 = 81.4; ROUGE-L = 85.3) y la clasificación de figuras médicas (F1 = 96.5). La revisión manual realizada por cinco anotadores, tres con formación médica, encontró que el 95.3 % de las imágenes de MedPMC eran médicamente relevantes, frente al 19.7 % en un conjunto de datos previo derivado de PMC. En 26 puntos de referencia que abarcan 11 especialidades, un modelo de estilo CLIP entrenado con MedPMC mejoró el AUC promedio de cero disparos en 7.1 puntos porcentuales en comparación con la línea base biomédica CLIP más fuerte con arquitectura equivalente, a pesar de utilizar menos de la mitad de pares de imagen-texto. Como codificador de visión en un modelo de lenguaje grande multimodal, mejoró la respuesta a preguntas visuales médicas en 1.9 y 16.9 puntos porcentuales en dos puntos de referencia. En 10,524 fotografías de dermatología del Sistema de Salud Yale New Haven, mejoró el Recall@5 en la recuperación de morfología a imagen en 11.7 puntos porcentuales. Estos hallazgos demuestran que la curación de literatura de alta fidelidad fortalece los modelos fundacionales multimodales médicos tanto en entornos de referencia como clínicos. Publicamos de forma abierta el marco, el corpus, los puntos de referencia y los modelos preentrenados.
English
Medicine is inherently multimodal, requiring clinicians to synthesize information across diverse data streams. Yet the development of multimodal foundation models is constrained by limited access to large-scale, high-quality clinical data. Although PubMed Central (PMC) offers a complementary source of expert-authored image-text data, existing PMC-derived resources remain limited in fidelity, reproducibility, and clinical validation. We introduce MedPMC, an automated, continuously updatable framework that transforms permissively licensed literature into high-fidelity infrastructure for medical multimodal models. Applied to 6.1 million PMC articles, MedPMC curated 11 million medical image-text pairs. Component evaluations showed strong performance for initial screening (F1 = 93.2), multi-panel figure detection (F1 = 96.5), figure separation (mAP = 89.8), caption separation and alignment (F1 = 81.4; ROUGE-L = 85.3), and medical figure classification (F1 = 96.5). Manual review by five annotators, three with medical training, found 95.3% of MedPMC images medically relevant, versus 19.7% in a prior PMC-derived dataset. Across 26 benchmarks spanning 11 specialties, a MedPMC-trained CLIP-style model improved average zero-shot AUC by 7.1 percentage points over the strongest architecture-matched biomedical CLIP baseline despite using fewer than half as many image-text pairs. As the vision encoder in a multimodal large language model, it improved medical visual question-answering by 1.9 and 16.9 percentage points across two benchmarks. In 10,524 Yale New Haven Health System dermatology photographs, it improved morphology-to-image retrieval Recall@5 by 11.7 percentage points. These findings show that high-fidelity literature curation strengthens medical multimodal foundation models across benchmark and clinical settings. We publicly release the framework, corpus, benchmarks, and pretrained models.