Identidade do Falante em Vocalizações Não-Verbais: Abordagem de Destilação Condicional e Mistura de Especialistas
Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach
June 19, 2026
Autores: Tzu-Chieh Wei, Yi-Cheng Lin, Huang-Cheng Chou, Kuan-Yu Chen, Hsin-Yen Sung, Shrikanth Narayanan, Hung-yi Lee
cs.AI
Resumo
Sistemas expressivos de síntese de fala (TTS) e conversão de voz (VC) geram cada vez mais vocalizações não verbais (NVVs) para aprimorar a naturalidade, tornando essencial uma verificação confiável do locutor (SV) para avaliar objetivamente a consistência de identidade em segmentos verbais e não verbais. No entanto, os sistemas atuais de SV generalizam-se mal para NVVs, e o ajuste fino em dados de NVV causa esquecimento catastrófico do desempenho em fala. Apresentamos o primeiro estudo sistemático abrangendo 10 tipos de NVV e propomos uma abordagem que combina características auto-supervisionadas do Data2Vec congeladas com a ECAPA-TDNN, aprimorada por um módulo de Mistura de Especialistas (MoE) com roteamento aprendido com consciência de domínio. Uma perda de destilação condicional sobre entradas de fala, por meio de um professor pré-treinado, preserva a precisão fala-a-fala, enquanto uma perda contrastiva reduz a lacuna entre os domínios de fala e NVV. Nosso método reduz a TEE (Taxa de Erro Igual) fala-NVV de 38,93% para 22,66% em relação a uma linha de base pré-treinada e melhora a TEE de fala de 13,17% para 9,24% por meio da destilação.
English
As expressive text-to-speech (TTS) and voice conversion (VC) systems increasingly generate non-verbal vocalizations (NVVs) to enhance naturalness, reliable speaker verification (SV) becomes essential to objectively assess identity consistency across both verbal and non-verbal segments. Yet current SV systems generalize poorly to NVVs, and fine-tuning on NVV data causes catastrophic forgetting of speech performance. We present the first systematic study across 10 NVV types and propose a framework combining frozen Data2Vec self-supervised features with ECAPA-TDNN, enhanced by a Mixture of Experts (MoE) module with learned domain-aware routing. A conditional distillation loss on speech inputs via a pretrained teacher retains speech-to-speech accuracy, while a contrastive loss bridges the speech-NVV domain gap. Our method reduces speech-NVV EER from 38.93% to 22.66% over a pretrained baseline, and improves speech EER from 13.17% to 9.24% via distillation.