ChatPaper.aiChatPaper

Sprekerbewuste temporele aggregatiestrategieën voor segmentrepresentaties voor depressiedetectie in dyadische interactie: een benchmarkstudie

Speaker-Aware Temporal Aggregation Strategies on Segment Representations for Depression Detection in Dyadic Interaction: A Benchmark Study

July 3, 2026
Auteurs: Anisha Pattanayak, Huang-Cheng Chou, Shrikanth Narayanan, Sudarsana Reddy Kadiri
cs.AI

Samenvatting

Spraakgebaseerde depressiedetectie comprimeert kenmerken van korte audiosegmenten tot één beslissing op sprekersniveau, een stap die temporele aggregatie wordt genoemd en zelden op zichzelf wordt bestudeerd. De meeste benchmarks gebruiken een vaste, zelfgecontroleerde encoder en een enkele handmatig gekozen laag, waardoor een gerapporteerde verbetering eerder de pijplijn kan weerspiegelen dan de aggregatiemethode zelf. We introduceren DEPOOL, een gecontroleerde benchmark die zes aggregatiearchitecturen vergelijkt met zes bevroren spraak-backbones op een Engels en een Mandarijns depressiecorpus, waarbij elke configuratie leert welke backbone-lagen van belang zijn in plaats van er handmatig een te kiezen. In het resulterende raster van 72 configuraties stort een derde van de configuraties in en voorspelt voor elke spreker slechts één klasse, een falen dat evenzeer aan de backbone als aan de methode is gebonden, en de architectuur die het meest stabiel is in een enkele seed-run wordt onbetrouwbaar wanneer training zich herhaalt over seeds. Robuustheid ten opzichte van backbone en seed, in plaats van gemiddelde nauwkeurigheid over een enkele pijplijn, zou een eersteklas benchmarkcriterium moeten zijn voor temporele aggregatie in klinische spraak.
English
Speech-based depression detection compresses features from short audio segments into one speaker-level decision, a step called temporal aggregation rarely studied on its own. Most benchmarks fix a single self-supervised encoder and a single hand-picked layer, so a reported gain may reflect the pipeline rather than the aggregation method itself. We introduce DEPOOL, a controlled benchmark that compares six aggregation architectures with six frozen speech backbones on an English and a Mandarin depression corpus, where each configuration learns which backbone layers matter rather than fixing one by hand. Across the resulting 72-configuration grid, a third of configurations collapse into predicting a single class for every speaker, a failure tied to the backbone as much as to the method, and the architecture that is most stable in a single-seed run becomes unreliable when training repeats across seeds. Robustness to backbone and seed, rather than average accuracy across a single pipeline, should be a first-class benchmarking criterion for temporal aggregation in clinical speech.