ChatPaper.aiChatPaper

Regresión por Fragmentos Desacoplada del Hablante para Tokenización Silábica

Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization

July 5, 2026
Autores: Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki
cs.AI

Resumen

La tokenización silábica no supervisada tiene como objetivo aprender tokens silábicos discretos que capturen la estructura latente relacionada con el contenido lingüístico a partir del habla en bruto. Los métodos recientes de tokenización silábica emplean la destilación profesor-alumno del HuBERT preentrenado para organizar las representaciones latentes de los marcos de habla en segmentos silábicos. Sin embargo, cuando se entrena con un objetivo de entropía cruzada a nivel de enunciado, el modelo predice la identidad del hablante en lugar del contenido lingüístico, comprometiendo así la pureza de los tokens silábicos. Para abordar este problema, proponemos un tokenizador silábico desenredado del hablante que regresa las representaciones del alumno perturbadas por el hablante hacia objetivos limpios del profesor dentro de fragmentos de longitud fija. Los resultados experimentales demuestran que nuestro método propuesto logra un rendimiento de vanguardia en la detección de límites silábicos y la agrupación de segmentos silábicos. Además, un modelo de lenguaje del habla entrenado con nuestros tokens silábicos logra una mejora relativa del 7% en la comprensión sintáctica y semántica en comparación con el SpiRit-LM a nivel de fonemas.
English
Unsupervised syllabic tokenization aims to learn discrete syllabic tokens that capture latent linguistic content-related structure from raw speech. Recent syllabic tokenization methods employ teacher-student distillation of the pretrained HuBERT to organize latent speech frame representations into syllabic segments. However, when trained with an utterance-level cross-entropy objective, the model predicts speaker identity rather than linguistic content, thereby compromising the purity of syllabic tokens. To address this problem, we propose a speaker-disentangled syllabic tokenizer that regresses speaker-perturbed student representations toward clean teacher targets within fixed-length chunks. Experimental results demonstrate that our proposed method achieves state-of-the-art performance in syllable boundary detection and syllabic segment clustering. Moreover, a speech language model trained on our syllabic tokens achieves a 7% relative improvement in syntactic and semantic understanding over the phone-level SpiRit-LM.