ChatPaper.aiChatPaper

MedPMC: Систематический фреймворк для масштабирования высококачественных медицинских мультимодальных данных для фундаментальных моделей

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

July 8, 2026
Авторы: Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen
cs.AI

Аннотация

Медицина по своей сути мультимодальна: врачам необходимо синтезировать информацию из различных потоков данных. Однако разработка мультимодальных фундаментальных моделей ограничена ограниченным доступом к крупномасштабным высококачественным клиническим данным. Хотя PubMed Central (PMC) предлагает дополнительный источник экспертных данных в формате «изображение-текст», существующие ресурсы на основе PMC остаются ограниченными по достоверности, воспроизводимости и клинической валидации. Мы представляем MedPMC — автоматизированную, непрерывно обновляемую платформу, которая преобразует литературу с разрешительными лицензиями в высокодостоверную инфраструктуру для медицинских мультимодальных моделей. Применительно к 6,1 миллиона статей PMC платформа MedPMC отобрала 11 миллионов пар медицинских изображений и текстов. Оценка компонентов показала высокие результаты: начальный скрининг (F1 = 93,2), обнаружение многопанельных рисунков (F1 = 96,5), разделение рисунков (mAP = 89,8), разделение и выравнивание подписей (F1 = 81,4; ROUGE-L = 85,3) и классификация медицинских рисунков (F1 = 96,5). Ручная проверка пятью аннотаторами, трое из которых имели медицинскую подготовку, показала, что 95,3% изображений MedPMC являются медицински релевантными по сравнению с 19,7% в предыдущем наборе данных, полученном из PMC. На 26 тестах, охватывающих 11 специальностей, модель типа CLIP, обученная на MedPMC, улучшила средний показатель AUC при нулевом обучении на 7,1 процентного пункта по сравнению с самым сильным биомедицинским CLIP-базовым уровнем с аналогичной архитектурой, несмотря на использование менее половины пар «изображение-текст». В качестве кодировщика изображений в мультимодальной большой языковой модели она улучшила показатели медицинского визуального вопрос-ответа на 1,9 и 16,9 процентного пункта в двух тестах. На 10 524 дерматологических фотографиях из системы здравоохранения Yale New Haven Health System показатель Recall@5 при поиске изображений по морфологии улучшился на 11,7 процентного пункта. Эти результаты показывают, что курация литературы высокой достоверности укрепляет медицинские мультимодальные фундаментальные модели как в тестовых, так и в клинических условиях. Мы публично выпускаем платформу, корпус, тесты и предварительно обученные модели.
English
Medicine is inherently multimodal, requiring clinicians to synthesize information across diverse data streams. Yet the development of multimodal foundation models is constrained by limited access to large-scale, high-quality clinical data. Although PubMed Central (PMC) offers a complementary source of expert-authored image-text data, existing PMC-derived resources remain limited in fidelity, reproducibility, and clinical validation. We introduce MedPMC, an automated, continuously updatable framework that transforms permissively licensed literature into high-fidelity infrastructure for medical multimodal models. Applied to 6.1 million PMC articles, MedPMC curated 11 million medical image-text pairs. Component evaluations showed strong performance for initial screening (F1 = 93.2), multi-panel figure detection (F1 = 96.5), figure separation (mAP = 89.8), caption separation and alignment (F1 = 81.4; ROUGE-L = 85.3), and medical figure classification (F1 = 96.5). Manual review by five annotators, three with medical training, found 95.3% of MedPMC images medically relevant, versus 19.7% in a prior PMC-derived dataset. Across 26 benchmarks spanning 11 specialties, a MedPMC-trained CLIP-style model improved average zero-shot AUC by 7.1 percentage points over the strongest architecture-matched biomedical CLIP baseline despite using fewer than half as many image-text pairs. As the vision encoder in a multimodal large language model, it improved medical visual question-answering by 1.9 and 16.9 percentage points across two benchmarks. In 10,524 Yale New Haven Health System dermatology photographs, it improved morphology-to-image retrieval Recall@5 by 11.7 percentage points. These findings show that high-fidelity literature curation strengthens medical multimodal foundation models across benchmark and clinical settings. We publicly release the framework, corpus, benchmarks, and pretrained models.