ChatPaper.aiChatPaper

Regressão por Blocos Desvinculada do Locutor para Tokenização Silábica

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

July 5, 2026
Autores: Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki
cs.AI

Resumo

Tokenização silábica não supervisionada tem como objetivo aprender tokens silábicos discretos que capturam a estrutura latente relacionada ao conteúdo linguístico a partir de fala bruta. Métodos recentes de tokenização silábica empregam destilação professor-aluno do HuBERT pré-treinado para organizar representações latentes de quadros de fala em segmentos silábicos. No entanto, quando treinados com um objetivo de entropia cruzada em nível de enunciado, o modelo prevê a identidade do locutor em vez do conteúdo linguístico, comprometendo assim a pureza dos tokens silábicos. Para solucionar esse problema, propomos um tokenizador silábico com desentrelaçamento de locutor, que regride representações do aluno perturbadas pelo locutor em direção a alvos limpos do professor dentro de blocos de comprimento fixo. Resultados experimentais demonstram que o método proposto alcança desempenho de estado da arte na detecção de limites silábicos e no agrupamento de segmentos silábicos. Além disso, um modelo de linguagem de fala treinado em nossos tokens silábicos atinge uma melhoria relativa de 7% na compreensão sintática e semântica em comparação ao SpiRit-LM em nível de fone.
English
Unsupervised syllabic tokenization aims to learn discrete syllabic tokens that capture latent linguistic content-related structure from raw speech. Recent syllabic tokenization methods employ teacher-student distillation of the pretrained HuBERT to organize latent speech frame representations into syllabic segments. However, when trained with an utterance-level cross-entropy objective, the model predicts speaker identity rather than linguistic content, thereby compromising the purity of syllabic tokens. To address this problem, we propose a speaker-disentangled syllabic tokenizer that regresses speaker-perturbed student representations toward clean teacher targets within fixed-length chunks. Experimental results demonstrate that our proposed method achieves state-of-the-art performance in syllable boundary detection and syllabic segment clustering. Moreover, a speech language model trained on our syllabic tokens achieves a 7% relative improvement in syntactic and semantic understanding over the phone-level SpiRit-LM.