DentalGPT: Стимулирование мультимодального сложного мышления в стоматологии
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
December 12, 2025
Авторы: Zhenyang Cai, Jiaming Zhang, Junjie Zhao, Ziyi Zeng, Yanchao Li, Jingyi Liang, Junying Chen, Yunjin Yang, Jiajun You, Shuzhi Deng, Tongfei Wang, Wanting Chen, Chunxiu Hao, Ruiqi Xie, Zhenwei Wen, Xiangyi Feng, Zou Ting, Jin Zou Lin, Jianquan Li, Guangjun Yu, Liangyi Chen, Junwen Wang, Shan Jiang, Benyou Wang
cs.AI
Аннотация
Достоверная интерпретация мультимодальных данных в стоматологии крайне важна для автоматизации здравоохранения в этой области, однако современные мультимодальные большие языковые модели (MLLM) испытывают трудности с распознаванием мелких визуальных деталей и не обладают достаточными способностями к рассуждению для постановки точного диагноза. Для преодоления этих ограничений мы представляем DentalGPT — специализированную стоматологическую MLLM, разработанную с помощью инжектирования высококачественных доменных знаний и обучения с подкреплением. В частности, была создана крупнейшая на сегодняшний день аннотированная мультимодальная база данных по стоматологии, объединяющая более 120 тысяч стоматологических изображений с подробными описаниями, акцентирующими диагностически значимые визуальные признаки, что делает её мультимодальным набором данных с наиболее обширной коллекцией стоматологических изображений. Обучение на этом наборе данных значительно улучшает визуальное понимание моделью стоматологических состояний, а последующий этап обучения с подкреплением дополнительно усиливает её способность к мультимодальному сложному рассуждению. Всесторонние оценки на внутриротовых и панорамных бенчмарках, а также на стоматологических подмножествах медицинских бенчмарков VQA, показывают, что DentalGPT демонстрирует превосходные результаты в задачах классификации заболеваний и стоматологического визуального вопросно-ответного взаимодействия, превосходя многие передовые MLLM, несмотря на наличие всего 7 миллиардов параметров. Эти результаты свидетельствуют о том, что комбинация высококачественных стоматологических данных с поэтапной адаптацией предоставляет эффективный путь для создания мощных и узкоспециализированных стоматологических MLLM.
English
Reliable interpretation of multimodal data in dentistry is essential for automated oral healthcare, yet current multimodal large language models (MLLMs) struggle to capture fine-grained dental visual details and lack sufficient reasoning ability for precise diagnosis. To address these limitations, we present DentalGPT, a specialized dental MLLM developed through high-quality domain knowledge injection and reinforcement learning. Specifically, the largest annotated multimodal dataset for dentistry to date was constructed by aggregating over 120k dental images paired with detailed descriptions that highlight diagnostically relevant visual features, making it the multimodal dataset with the most extensive collection of dental images to date. Training on this dataset significantly enhances the MLLM's visual understanding of dental conditions, while the subsequent reinforcement learning stage further strengthens its capability for multimodal complex reasoning. Comprehensive evaluations on intraoral and panoramic benchmarks, along with dental subsets of medical VQA benchmarks, show that DentalGPT achieves superior performance in disease classification and dental VQA tasks, outperforming many state-of-the-art MLLMs despite having only 7B parameters. These results demonstrate that high-quality dental data combined with staged adaptation provides an effective pathway for building capable and domain-specialized dental MLLMs.