LingxiDiagBench : Un cadre multi-agent pour l'évaluation comparative des LLM dans la consultation et le diagnostic psychiatriques en chinois
LingxiDiagBench: A Multi-Agent Framework for Benchmarking LLMs in Chinese Psychiatric Consultation and Diagnosis
June 11, 2026
Auteurs: Shihao Xu, Tiancheng Zhou, Jiatong Ma, Yanli Ding, Yiming Yan, Ming Xiao, Guoyi Li, Haiyang Geng, Yunyun Han, Jianhua Chen, Yafeng Deng
cs.AI
Résumé
Les troubles mentaux sont très répandus dans le monde, mais la pénurie de psychiatres et la subjectivité inhérente au diagnostic basé sur des entretiens créent des obstacles considérables à une évaluation rapide et cohérente de la santé mentale. Les progrès du diagnostic psychiatrique assisté par l'IA sont limités par l'absence de références (benchmarks) qui fournissent simultanément une simulation réaliste des patients, des étiquettes diagnostiques vérifiées par des cliniciens, et un support pour une consultation dynamique à plusieurs tours. Nous présentons LingxiDiagBench, une référence multi-agent à grande échelle qui évalue les LLM à la fois sur l'inférence diagnostique statique et la consultation psychiatrique dynamique à plusieurs tours en chinois. Son cœur est LingxiDiag-16K, un ensemble de données de 16 000 dialogues de consultation synthétiques alignés sur des dossiers médicaux électroniques (EMR), conçus pour reproduire les distributions démographiques et diagnostiques cliniques réelles dans 12 catégories psychiatriques de la CIM-10. À travers des expériences approfondies sur des LLM de pointe, nous établissons des résultats clés : (1) bien que les LLM atteignent une précision élevée dans la classification binaire dépression-anxiété (jusqu'à 92,3 %), les performances se dégradent considérablement pour la reconnaissance de la comorbidité dépression-anxiété (43,0 %) et pour le diagnostic différentiel à 12 catégories (28,5 %) ; (2) la consultation dynamique est souvent moins performante que l'évaluation statique, ce qui indique que des stratégies inefficaces de collecte d'informations nuisent considérablement au raisonnement diagnostique en aval ; (3) la qualité de la consultation évaluée par LLM-as-a-Judge ne montre qu'une corrélation modérée avec la précision diagnostique, suggérant qu'un questionnement bien structuré seul ne garantit pas des décisions diagnostiques correctes. Nous publions LingxiDiag-16K et l'ensemble du cadre d'évaluation pour soutenir la recherche reproductible à l'adresse https://github.com/Lingxi-mental-health/LingxiDiagBench.
English
Mental disorders are highly prevalent worldwide, but the shortage of psychiatrists and the inherent subjectivity of interview-based diagnosis create substantial barriers to timely and consistent mental-health assessment. Progress in AI-assisted psychiatric diagnosis is constrained by the absence of benchmarks that simultaneously provide realistic patient simulation, clinician-verified diagnostic labels, and support for dynamic multi-turn consultation. We present LingxiDiagBench, a large-scale multi-agent benchmark that evaluates LLMs on both static diagnostic inference and dynamic multi-turn psychiatric consultation in Chinese. At its core is LingxiDiag-16K, a dataset of 16,000 EMR-aligned synthetic consultation dialogues designed to reproduce real clinical demographic and diagnostic distributions across 12 ICD-10 psychiatric categories. Through extensive experiments across state-of-the-art LLMs, we establish key findings: (1) although LLMs achieve high accuracy on binary depression--anxiety classification (up to 92.3%), performance deteriorates substantially for depression--anxiety comorbidity recognition (43.0%) and 12-way differential diagnosis (28.5%); (2) dynamic consultation often underperforms static evaluation, indicating that ineffective information-gathering strategies significantly impair downstream diagnostic reasoning; (3) consultation quality assessed by LLM-as-a-Judge shows only moderate correlation with diagnostic accuracy, suggesting that well-structured questioning alone does not ensure correct diagnostic decisions. We release LingxiDiag-16K and the full evaluation framework to support reproducible research at https://github.com/Lingxi-mental-health/LingxiDiagBench.