ChatPaper.aiChatPaper

IndicMedDialog : un ensemble de données parallèles de dialogues médicaux multi-tours pour des soins de santé accessibles dans les langues indiennes

IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages

May 13, 2026
Auteurs: Shubham Kumar Nigam, Suparnojit Sarkar, Piyush Patel
cs.AI

Résumé

La plupart des systèmes de dialogue médical existants fonctionnent selon un paradigme de questions-réponses en un seul tour ou reposent sur des ensembles de données basés sur des modèles, ce qui limite le réalisme conversationnel et l'applicabilité multilingue. Nous présentons IndicMedDialog, un ensemble de données de dialogues médicaux multi-tours parallèles couvrant l'anglais et neuf langues indiennes : assamais, bengali, gujarati, hindi, marathi, pendjabi, tamoul, télougou et ourdou. Cet ensemble de données étend MDDial avec des consultations synthétiques générées par LLM, traduites à l'aide de TranslateGemma, vérifiées par des locuteurs natifs et affinées via un pipeline de post-traitement sensible aux écritures pour corriger les erreurs phonétiques, lexicales et d'espacement des caractères. En nous appuyant sur cet ensemble de données, nous affinons IndicMedLM via une adaptation efficace en paramètres d'un petit modèle de langage quantifié, en intégrant un pré-contexte patient optionnel pour personnaliser l'élicitation des symptômes en plusieurs tours. Nous évaluons par rapport à des références multilingues zéro-shot, effectuons une analyse systématique des erreurs dans dix langues et validons la plausibilité clinique par une évaluation d'experts médicaux.
English
Most existing medical dialogue systems operate in a single-turn question--answering paradigm or rely on template-based datasets, limiting conversational realism and multilingual applicability. We introduce IndicMedDialog, a parallel multi-turn medical dialogue dataset spanning English and nine Indic languages: Assamese, Bengali, Gujarati, Hindi, Marathi, Punjabi, Tamil, Telugu, and Urdu. The dataset extends MDDial with LLM-generated synthetic consultations, translated using TranslateGemma, verified by native speakers, and refined through a script-aware post-processing pipeline to correct phonetic, lexical, and character-spacing errors. Building on this dataset, we fine-tune IndicMedLM via parameter-efficient adaptation of a quantized small language model, incorporating optional patient pre-context to personalise multi-turn symptom elicitation. We evaluate against zero-shot multilingual baselines, conduct systematic error analysis across ten languages, and validate clinical plausibility through medical expert evaluation.