LASE: Codificação de Locutor por Adversariedade Linguística para Preservação de Identidade Interescritas em Línguas Índicas
LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation
May 1, 2026
Autores: Venkata Pushpak Teja Menta
cs.AI
Resumo
Um codificador de orador utilizado em clonagem de voz multilingue deve tratar o mesmo orador de forma idêntica, independentemente do script em que o áudio foi proferido. Os codificadores disponíveis comercialmente não o fazem, e a falha é condicionada ao sotaque. Num corpus de voz com 1043 pares de sotaque ocidental, abrangendo inglês, hindi, telugu e tâmil, o WavLM-base-plus-sv perde 0,082 de similaridade de cosseno absoluta quando a mesma voz muda de script, e o ECAPA-TDNN perde 0,105. Num corpus de voz com 1369 pares de sotaque indiano, a diferença reduz-se para 0,006 (WavLM-SV) e 0,044 (ECAPA-TDNN). A fuga é maior onde é mais importante para o TTS entre scripts: quando um sistema projeta uma voz não treinada em línguas índicas para scripts índicos. Apresentamos o LASE (Language-Adversarial Speaker Encoder), uma pequena cabeça de projeção sobre o WavLM-base-plus congelado, treinada com duas funções de perda: uma perda contrastiva supervisionada sobre a identidade da voz e uma entropia cruzada com reversão de gradiente contra um classificador de 4 línguas que força o *embedding* a ser não informativo sobre a língua, mantendo-se informativo sobre o orador. Treinado em 1118 pares entre scripts com controlo de qualidade, sintetizados a partir de 8 vozes multilingues comerciais, a diferença residual do LASE é consistente com zero em ambos os corpora (Δ = 0,013 Ocidental, Δ = 0,026 Indiano; ambos os ICs de 95% *bootstrap* incluem zero) e amplifica a margem entre-script-vs-base 2,4-2,7x em relação a ambas as linhas de base. Uma ablação ECAPA+GRL mostra que o objetivo GRL melhora qualquer *backbone*, mas a escolha do WavLM também contribui. Na diarização de multi-orador sintética, o LASE equipara-se ao ECAPA-TDNN na revocação de oradores entre scripts (0,788 vs 0,789) com ~100x menos dados de treino. Disponibilizamos o *checkpoint* r1, ambos os corpora e a receita *bootstrap*.
English
A speaker encoder used in multilingual voice cloning should treat the same speaker identically regardless of which script the audio was uttered in. Off-the-shelf encoders do not, and the failure is accent-conditional. On a 1043-pair Western-accented voice corpus across English, Hindi, Telugu, and Tamil, WavLM-base-plus-sv loses 0.082 absolute cosine similarity when the same voice changes script and ECAPA-TDNN loses 0.105. On a 1369-pair Indian-accented voice corpus, the gap shrinks to 0.006 (WavLM-SV) and 0.044 (ECAPA-TDNN). The leak is largest where it matters most for cross-script TTS: when a system projects a non-Indic-trained voice into Indic scripts. We present LASE (Language-Adversarial Speaker Encoder), a small projection head over frozen WavLM-base-plus trained with two losses: a supervised contrastive loss over voice identity, and a gradient-reversal cross-entropy against a 4-language classifier that pushes the embedding to be language-uninformative while remaining speaker-informative. Trained on 1118 quality-gated cross-script pairs synthesised from 8 commercial multilingual voices, LASE's residual gap is consistent with zero on both corpora (Delta = 0.013 Western, Delta = 0.026 Indian; both bootstrap 95% CIs include zero) and amplifies the cross-script-vs-floor margin 2.4-2.7x over both baselines. An ECAPA+GRL ablation shows the GRL objective improves either backbone but the WavLM choice contributes too. In synthetic multi-speaker diarisation, LASE matches ECAPA-TDNN on cross-script speaker recall (0.788 vs 0.789) with ~100x less training data. We release the r1 checkpoint, both corpora, and the bootstrap recipe.