AMRD: 軽量音声感情認識のための適応的マルチティーチャー関係蒸留
AMRD: Adaptive Multi-Teacher Relational Distillation for Lightweight Speech Emotion Recognition
July 28, 2026
著者: Yuqi Li, Yi-Cheng Lin, Xianglong Wang, Kuo Yang, Xiaoqin Feng, Yixuan Wang, Huiran Duan, Yingli Tian
cs.AI
要旨
オンデバイス音声感情認識(SER)はリアルタイム応用にとって重要であるが、SERに優れた大規模な自己教師ありモデルはエッジデバイスにとってコストが高すぎる。マルチティーチャー知識蒸留はそれらを軽量な生徒モデルへ圧縮できるが、2つの課題が残る。すなわち、ティーチャーの信頼性がバッチごとに異なること、そしてロジットレベルの蒸留がサンプル間の関係構造を無視することである。これらの課題に対処するため、我々は適応的マルチティーチャー関係蒸留(AMRD)を提案する。各ティーチャーのロジット類似度行列に対するワンクラスSVMは、より一貫性のあるティーチャーを優先するバッチごとの重みを割り当てる。関係蒸留損失はティーチャーと生徒の類似度行列を整合させ、ロジットマッチングでは捉えられない構造を獲得する。IEMOCAPおよびCREMA-Dデータセット上の4つの生徒アーキテクチャにわたって、AMRDはほとんどの設定でシングルティーチャー蒸留ベースラインを上回り、アブレーションにより両方の構成要素が相補的な利得をもたらすことが確認された。
English
On-device speech emotion recognition (SER) is critical for real-time applications, yet large self-supervised models that excel at SER are too costly for edge devices. Multi-teacher knowledge distillation can compress them into a lightweight student, but two challenges remain: teacher reliability varies across batches, and logit-level distillation ignores inter-sample relational structure. We propose Adaptive Multi-teacher Relational Distillation (AMRD) to address both. A one-class SVM on each teacher's logit similarity matrix assigns per-batch weights favoring more coherent teachers. A relational distillation loss aligns teacher and student similarity matrices, capturing structure that logit matching misses. On IEMOCAP and CREMA-D datasets across four student architectures, AMRD outperforms single-teacher distillation baselines in most settings, and ablations confirm both components yield complementary gains.