ChatPaper.aiChatPaper

Laagsgewijze cross-linguale detectie van depressie uit spraak: analyse met contrastieve uitlijning

Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment

July 3, 2026
Auteurs: Anisha Pattanayak, Hanie Kang, Huang-Cheng Chou, Shrikanth Narayanan, Sudarsana Reddy Kadiri
cs.AI

Samenvatting

Er bestaan significante verschillen in de diagnose en klinische presentatie van depressie tussen verschillende taalgemeenschappen. Spraakgebaseerde depressiedetectie presteert goed eentalig, maar cross-linguale generalisatie blijft een open uitdaging. Een belangrijke reden is dat eerder werk gebruikmaakt van willekeurige splitsingen op segmentniveau zonder sprekersgroepering, wat leidt tot identiteitslekken die de gerapporteerde metrieken opdrijven. Wij stellen CLeaD voor, een gesuperviseerd contrastief uitlijningsraamwerk dat WavLM-embeddings uit het Engels en Mandarijns in een gedeelde klinische ruimte projecteert, zonder parallelle data of fijnafstemming op de doeltaal. Bij evaluatie van 52 Mandarijnse sprekers presteert contrastieve uitlijning bescheiden beter dan de basislijn (F1: 0,640 vs. 0,622) onder 'leave-one-speaker-out'-evaluatie. Het verbetert ook de recall van de depressieklasse in tussenliggende lagen (7-8), hoewel de kleine testset de generaliseerbaarheid beperkt. Twee bevindingen blijven robuust: modelschaling verslechtert de cross-linguale prestaties terwijl het eentalig Engels verbetert, en spraakidentiteitslekken hebben eerder gerapporteerde Mandarijnse F1-scores kunstmatig opgedreven tot 0,954, een artefact dat wij reproduceren en kwantificeren.
English
Significant disparities exist in the diagnosis and clinical presentation of depression across different linguistic populations. Speech-based depression detection performs well monolingually, but cross-lingual generalization remains an open challenge. A key reason is that prior work uses segment-level random splits without speaker grouping, leading to identity leakage that inflates reported metrics. We propose CLeaD, a supervised contrastive alignment framework that maps WavLM embeddings from English and Mandarin into a shared clinical space, without parallel data or target-language fine-tuning. Evaluating 52 Mandarin speakers, contrastive alignment modestly outperforms the baseline (F1: 0.640 vs. 0.622) under leave-one-speaker-out evaluation. It also improves depressed-class recall at intermediate layers (7-8), though the small test set limits generalizability. Two findings remain robust: model scaling degrades cross-lingual performance while improving monolingual English, and speaker identity leakage artificially inflated previously reported Mandarin F1 scores to 0.954, an artifact we reproduce and quantify.