LingxiDiagBench: Um Framework Multiagente para Benchmarking de LLMs em Consulta e Diagnóstico Psiquiátrico Chinês
LingxiDiagBench: A Multi-Agent Framework for Benchmarking LLMs in Chinese Psychiatric Consultation and Diagnosis
June 11, 2026
Autores: Shihao Xu, Tiancheng Zhou, Jiatong Ma, Yanli Ding, Yiming Yan, Ming Xiao, Guoyi Li, Haiyang Geng, Yunyun Han, Jianhua Chen, Yafeng Deng
cs.AI
Resumo
Os transtornos mentais são altamente prevalentes em todo o mundo, mas a escassez de psiquiatras e a subjetividade inerente ao diagnóstico baseado em entrevistas criam barreiras substanciais para uma avaliação de saúde mental oportuna e consistente. O progresso no diagnóstico psiquiátrico assistido por IA é limitado pela ausência de benchmarks que simultaneamente forneçam simulação realista de pacientes, rótulos diagnósticos verificados por clínicos e suporte para consultas dinâmicas de múltiplas rodadas. Apresentamos o LingxiDiagBench, um benchmark multiagente em larga escala que avalia LLMs tanto em inferência diagnóstica estática quanto em consulta psiquiátrica dinâmica de múltiplas rodadas em chinês. Em seu núcleo está o LingxiDiag-16K, um conjunto de dados de 16.000 diálogos de consulta sintéticos alinhados a RME, projetados para reproduzir distribuições demográficas e diagnósticas clínicas reais em 12 categorias psiquiátricas da CID-10. Por meio de experimentos extensivos com LLMs de última geração, estabelecemos descobertas-chave: (1) embora os LLMs alcancem alta precisão na classificação binária depressão–ansiedade (até 92,3%), o desempenho deteriora-se substancialmente para o reconhecimento de comorbidade depressão–ansiedade (43,0%) e para o diagnóstico diferencial de 12 vias (28,5%); (2) a consulta dinâmica frequentemente tem desempenho inferior à avaliação estática, indicando que estratégias ineficazes de coleta de informações prejudicam significativamente o raciocínio diagnóstico subsequente; (3) a qualidade da consulta avaliada pelo LLM como Juiz mostra apenas correlação moderada com a precisão diagnóstica, sugerindo que apenas perguntas bem estruturadas não garantem decisões diagnósticas corretas. Disponibilizamos o LingxiDiag-16K e o framework completo de avaliação para apoiar pesquisas reproduzíveis em https://github.com/Lingxi-mental-health/LingxiDiagBench.
English
Mental disorders are highly prevalent worldwide, but the shortage of psychiatrists and the inherent subjectivity of interview-based diagnosis create substantial barriers to timely and consistent mental-health assessment. Progress in AI-assisted psychiatric diagnosis is constrained by the absence of benchmarks that simultaneously provide realistic patient simulation, clinician-verified diagnostic labels, and support for dynamic multi-turn consultation. We present LingxiDiagBench, a large-scale multi-agent benchmark that evaluates LLMs on both static diagnostic inference and dynamic multi-turn psychiatric consultation in Chinese. At its core is LingxiDiag-16K, a dataset of 16,000 EMR-aligned synthetic consultation dialogues designed to reproduce real clinical demographic and diagnostic distributions across 12 ICD-10 psychiatric categories. Through extensive experiments across state-of-the-art LLMs, we establish key findings: (1) although LLMs achieve high accuracy on binary depression--anxiety classification (up to 92.3%), performance deteriorates substantially for depression--anxiety comorbidity recognition (43.0%) and 12-way differential diagnosis (28.5%); (2) dynamic consultation often underperforms static evaluation, indicating that ineffective information-gathering strategies significantly impair downstream diagnostic reasoning; (3) consultation quality assessed by LLM-as-a-Judge shows only moderate correlation with diagnostic accuracy, suggesting that well-structured questioning alone does not ensure correct diagnostic decisions. We release LingxiDiag-16K and the full evaluation framework to support reproducible research at https://github.com/Lingxi-mental-health/LingxiDiagBench.