ChatPaper.aiChatPaper

Послойное кросс-лингвальное обнаружение депрессии по речи: анализ с контрастивным выравниванием

Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment

July 3, 2026
Авторы: Anisha Pattanayak, Hanie Kang, Huang-Cheng Chou, Shrikanth Narayanan, Sudarsana Reddy Kadiri
cs.AI

Аннотация

Значительные различия существуют в диагностике и клинических проявлениях депрессии среди разных языковых популяций. Выявление депрессии по речи хорошо работает в одноязычном режиме, однако кросс-языковое обобщение остаётся открытой проблемой. Ключевая причина заключается в том, что предыдущие работы используют случайное разбиение на уровне сегментов без группировки по дикторам, что приводит к утечке идентичности и завышает сообщаемые показатели. Мы предлагаем CLeaD — фреймворк контролируемого контрастивного выравнивания, который отображает эмбеддинги WavLM из английского и мандаринского языков в общее клиническое пространство без параллельных данных или тонкой настройки на целевом языке. При оценке на 52 носителях мандаринского языка контрастивное выравнивание незначительно превосходит базовый метод (F1: 0,640 против 0,622) в условиях оценки с исключением одного диктора. Оно также улучшает полноту для класса депрессии на промежуточных слоях (7–8), хотя небольшой тестовый набор ограничивает обобщаемость. Два вывода остаются устойчивыми: масштабирование модели ухудшает кросс-языковую производительность при одновременном улучшении одноязычной для английского, а утечка идентичности диктора искусственно завышала ранее сообщаемые значения F1 для мандаринского до 0,954 — артефакт, который мы воспроизводим и количественно оцениваем.
English
Significant disparities exist in the diagnosis and clinical presentation of depression across different linguistic populations. Speech-based depression detection performs well monolingually, but cross-lingual generalization remains an open challenge. A key reason is that prior work uses segment-level random splits without speaker grouping, leading to identity leakage that inflates reported metrics. We propose CLeaD, a supervised contrastive alignment framework that maps WavLM embeddings from English and Mandarin into a shared clinical space, without parallel data or target-language fine-tuning. Evaluating 52 Mandarin speakers, contrastive alignment modestly outperforms the baseline (F1: 0.640 vs. 0.622) under leave-one-speaker-out evaluation. It also improves depressed-class recall at intermediate layers (7-8), though the small test set limits generalizability. Two findings remain robust: model scaling degrades cross-lingual performance while improving monolingual English, and speaker identity leakage artificially inflated previously reported Mandarin F1 scores to 0.954, an artifact we reproduce and quantify.