Détection interlingue de la dépression à partir de la parole par couches : analyse avec alignement contrastif
Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment
July 3, 2026
Auteurs: Anisha Pattanayak, Hanie Kang, Huang-Cheng Chou, Shrikanth Narayanan, Sudarsana Reddy Kadiri
cs.AI
Résumé
Il existe des disparités significatives dans le diagnostic et la présentation clinique de la dépression selon les populations linguistiques. La détection de la dépression basée sur la parole fonctionne bien en contexte monolingue, mais la généralisation cross-lingue demeure un défi ouvert. Une raison clé est que les travaux antérieurs utilisent des divisions aléatoires au niveau des segments sans regroupement par locuteur, ce qui entraîne une fuite d'identité gonflant artificiellement les métriques rapportées. Nous proposons CLeaD, un cadre d'alignement contrastif supervisé qui projette les plongements WavLM issus de l'anglais et du mandarin dans un espace clinique partagé, sans données parallèles ni fine-tuning sur la langue cible. En évaluant 52 locuteurs mandarins, l'alignement contrastif surpasse modestement le baseline (F1 : 0,640 contre 0,622) dans une évaluation leave-one-speaker-out. Il améliore également le rappel de la classe dépressive aux couches intermédiaires (7-8), bien que la petite taille de l'ensemble de test limite la généralisabilité. Deux résultats restent robustes : le passage à l'échelle du modèle dégrade la performance cross-lingue tout en améliorant la performance monolingue en anglais, et la fuite d'identité du locuteur a artificiellement gonflé les scores F1 précédemment rapportés pour le mandarin à 0,954, artefact que nous reproduisons et quantifions.
English
Significant disparities exist in the diagnosis and clinical presentation of depression across different linguistic populations. Speech-based depression detection performs well monolingually, but cross-lingual generalization remains an open challenge. A key reason is that prior work uses segment-level random splits without speaker grouping, leading to identity leakage that inflates reported metrics. We propose CLeaD, a supervised contrastive alignment framework that maps WavLM embeddings from English and Mandarin into a shared clinical space, without parallel data or target-language fine-tuning. Evaluating 52 Mandarin speakers, contrastive alignment modestly outperforms the baseline (F1: 0.640 vs. 0.622) under leave-one-speaker-out evaluation. It also improves depressed-class recall at intermediate layers (7-8), though the small test set limits generalizability. Two findings remain robust: model scaling degrades cross-lingual performance while improving monolingual English, and speaker identity leakage artificially inflated previously reported Mandarin F1 scores to 0.954, an artifact we reproduce and quantify.