Spreker-ontwarde Broksgewijze Regressie voor Syllabische Tokenisatie
Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization
July 5, 2026
Auteurs: Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki
cs.AI
Samenvatting
Onge superviseerde syllabische tokenisatie streeft ernaar discrete syllabische tokens te leren die latente linguïstische inhoudsgerelateerde structuur uit ruwe spraak vastleggen. Recente syllabische tokenisatiemethoden maken gebruik van teacher-student distillatie van de voorgetrainde HuBERT om latente spraakframerpresentaties te organiseren in syllabische segmenten. Wanneer het model echter wordt getraind met een kruisentropiedoelstelling op uitingniveau, voorspelt het de sprekeridentiteit in plaats van de linguïstische inhoud, waardoor de zuiverheid van syllabische tokens in het gedrang komt. Om dit probleem aan te pakken, stellen we een spreker-ontwarde syllabische tokenizer voor die door sprekerverstoring beïnvloede studentrepresentaties regresseert naar schone teacherdoelen binnen chunks van vaste lengte. Experimentele resultaten tonen aan dat onze voorgestelde methode state-of-the-art prestaties behaalt in syllabegrensdetectie en syllabische segmentclustering. Bovendien behaalt een spraaktaalmodel dat is getraind op onze syllabische tokens een relatieve verbetering van 7% in syntactisch en semantisch begrip ten opzichte van het foneemniveau SpiRit-LM.
English
Unsupervised syllabic tokenization aims to learn discrete syllabic tokens that capture latent linguistic content-related structure from raw speech. Recent syllabic tokenization methods employ teacher-student distillation of the pretrained HuBERT to organize latent speech frame representations into syllabic segments. However, when trained with an utterance-level cross-entropy objective, the model predicts speaker identity rather than linguistic content, thereby compromising the purity of syllabic tokens. To address this problem, we propose a speaker-disentangled syllabic tokenizer that regresses speaker-perturbed student representations toward clean teacher targets within fixed-length chunks. Experimental results demonstrate that our proposed method achieves state-of-the-art performance in syllable boundary detection and syllabic segment clustering. Moreover, a speech language model trained on our syllabic tokens achieves a 7% relative improvement in syntactic and semantic understanding over the phone-level SpiRit-LM.