ChatPaper.aiChatPaper

Régression par blocs désentrelacée du locuteur pour la tokenisation syllabique

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

July 5, 2026
Auteurs: Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki
cs.AI

Résumé

La tokenisation syllabique non supervisée vise à apprendre des tokens syllabiques discrets qui capturent la structure latente liée au contenu linguistique à partir de la parole brute. Les méthodes récentes de tokenisation syllabique utilisent une distillation enseignant-étudiant du modèle HuBERT pré-entraîné pour organiser les représentations latentes des trames de parole en segments syllabiques. Cependant, lorsqu'il est entraîné avec un objectif d'entropie croisée au niveau de l'énoncé, le modèle prédit l'identité du locuteur plutôt que le contenu linguistique, compromettant ainsi la pureté des tokens syllabiques. Pour résoudre ce problème, nous proposons un tokeniseur syllabique désentrelacé du locuteur qui régresse les représentations de l'étudiant, perturbées par le locuteur, vers des cibles propres de l'enseignant dans des blocs de longueur fixe. Les résultats expérimentaux montrent que notre méthode proposée atteint des performances de pointe en détection des frontières syllabiques et en regroupement des segments syllabiques. De plus, un modèle de langage vocal entraîné sur nos tokens syllabiques obtient une amélioration relative de 7 % de la compréhension syntaxique et sémantique par rapport au SpiRit-LM au niveau des phones.
English
Unsupervised syllabic tokenization aims to learn discrete syllabic tokens that capture latent linguistic content-related structure from raw speech. Recent syllabic tokenization methods employ teacher-student distillation of the pretrained HuBERT to organize latent speech frame representations into syllabic segments. However, when trained with an utterance-level cross-entropy objective, the model predicts speaker identity rather than linguistic content, thereby compromising the purity of syllabic tokens. To address this problem, we propose a speaker-disentangled syllabic tokenizer that regresses speaker-perturbed student representations toward clean teacher targets within fixed-length chunks. Experimental results demonstrate that our proposed method achieves state-of-the-art performance in syllable boundary detection and syllabic segment clustering. Moreover, a speech language model trained on our syllabic tokens achieves a 7% relative improvement in syntactic and semantic understanding over the phone-level SpiRit-LM.