ChatPaper.aiChatPaper

Стратегии временной агрегации с учетом говорящего на основе сегментных представлений для обнаружения депрессии в диадическом взаимодействии: эталонное исследование

Speaker-Aware Temporal Aggregation Strategies on Segment Representations for Depression Detection in Dyadic Interaction: A Benchmark Study

July 3, 2026
Авторы: Anisha Pattanayak, Huang-Cheng Chou, Shrikanth Narayanan, Sudarsana Reddy Kadiri
cs.AI

Аннотация

Обнаружение депрессии на основе речи сжимает признаки из коротких аудиосегментов в одно решение на уровне говорящего — этап, называемый временной агрегацией, который редко изучается самостоятельно. В большинстве эталонных тестов фиксируется один самообучаемый кодировщик и один вручную выбранный слой, поэтому заявленное улучшение может отражать конвейер, а не сам метод агрегации. Мы представляем DEPOOL — контролируемый эталонный тест, который сравнивает шесть архитектур агрегации с шестью замороженными речевыми базовыми моделями на корпусах депрессии на английском и китайском языках, где каждая конфигурация обучается определять, какие слои базовой модели значимы, а не фиксирует их вручную. В полученной сетке из 72 конфигураций треть коллапсирует, предсказывая только один класс для каждого говорящего, — сбой, связанный как с базовой моделью, так и с методом, а архитектура, наиболее стабильная при однозатравочном запуске, становится ненадёжной при повторных запусках с разными начальными значениями. Устойчивость к базовой модели и начальному значению, а не средняя точность на одном конвейере, должна стать первостепенным критерием сравнения для временной агрегации в клинической речи.
English
Speech-based depression detection compresses features from short audio segments into one speaker-level decision, a step called temporal aggregation rarely studied on its own. Most benchmarks fix a single self-supervised encoder and a single hand-picked layer, so a reported gain may reflect the pipeline rather than the aggregation method itself. We introduce DEPOOL, a controlled benchmark that compares six aggregation architectures with six frozen speech backbones on an English and a Mandarin depression corpus, where each configuration learns which backbone layers matter rather than fixing one by hand. Across the resulting 72-configuration grid, a third of configurations collapse into predicting a single class for every speaker, a failure tied to the backbone as much as to the method, and the architecture that is most stable in a single-seed run becomes unreliable when training repeats across seeds. Robustness to backbone and seed, rather than average accuracy across a single pipeline, should be a first-class benchmarking criterion for temporal aggregation in clinical speech.