Stratégies d'agrégation temporelle tenant compte du locuteur sur les représentations de segments pour la détection de la dépression dans l'interaction dyadique : une étude comparative
Speaker-Aware Temporal Aggregation Strategies on Segment Representations for Depression Detection in Dyadic Interaction: A Benchmark Study
July 3, 2026
Auteurs: Anisha Pattanayak, Huang-Cheng Chou, Shrikanth Narayanan, Sudarsana Reddy Kadiri
cs.AI
Résumé
La détection de la dépression basée sur la parole compresse les caractéristiques de courts segments audio en une décision au niveau du locuteur, une étape appelée agrégation temporelle rarement étudiée en elle-même. La plupart des benchmarks fixent un seul encodeur auto-supervisé et une seule couche choisie manuellement, de sorte qu'un gain rapporté peut refléter le pipeline plutôt que la méthode d'agrégation elle-même. Nous présentons DEPOOL, un benchmark contrôlé qui compare six architectures d'agrégation avec six backbones de parole gelés sur un corpus de dépression en anglais et un en mandarin, où chaque configuration apprend quelles couches du backbone sont importantes plutôt que d'en fixer une manuellement. Dans la grille de 72 configurations résultante, un tiers des configurations s'effondrent en prédisant une seule classe pour chaque locuteur, un échec lié au backbone autant qu'à la méthode, et l'architecture la plus stable dans une exécution à une seule graine devient peu fiable lorsque l'entraînement est répété sur plusieurs graines. La robustesse au backbone et à la graine, plutôt que la précision moyenne sur un seul pipeline, devrait être un critère de benchmark de première classe pour l'agrégation temporelle dans la parole clinique.
English
Speech-based depression detection compresses features from short audio segments into one speaker-level decision, a step called temporal aggregation rarely studied on its own. Most benchmarks fix a single self-supervised encoder and a single hand-picked layer, so a reported gain may reflect the pipeline rather than the aggregation method itself. We introduce DEPOOL, a controlled benchmark that compares six aggregation architectures with six frozen speech backbones on an English and a Mandarin depression corpus, where each configuration learns which backbone layers matter rather than fixing one by hand. Across the resulting 72-configuration grid, a third of configurations collapse into predicting a single class for every speaker, a failure tied to the backbone as much as to the method, and the architecture that is most stable in a single-seed run becomes unreliable when training repeats across seeds. Robustness to backbone and seed, rather than average accuracy across a single pipeline, should be a first-class benchmarking criterion for temporal aggregation in clinical speech.