Дикторо-раздельная покусочная регрессия для слоговой токенизации
Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization
July 5, 2026
Авторы: Ryota Komatsu, Kota Kawakita, Takuma Okamoto, Takahiro Shinozaki
cs.AI
Аннотация
Неконтролируемая слоговая токенизация направлена на изучение дискретных слоговых токенов, которые захватывают скрытую структуру, связанную с лингвистическим содержанием, из необработанной речи. Современные методы слоговой токенизации используют дистилляцию по схеме «учитель-ученик» предварительно обученной модели HuBERT для организации скрытых представлений речевых фреймов в слоговые сегменты. Однако при обучении с использованием функции перекрестной энтропии на уровне высказываний модель предсказывает идентичность говорящего, а не лингвистическое содержание, что снижает чистоту слоговых токенов. Для решения этой проблемы мы предлагаем слоговой токенизатор, свободный от влияния говорящего, который регрессирует возмущенные представления ученика к чистым целям учителя внутри блоков фиксированной длины. Экспериментальные результаты показывают, что предложенный метод достигает самых современных результатов в обнаружении границ слогов и кластеризации слоговых сегментов. Кроме того, языковая модель речи, обученная на наших слоговых токенах, достигает относительного улучшения на 7% в понимании синтаксиса и семантики по сравнению с моделью SpiRit-LM на уровне фонем.
English
Unsupervised syllabic tokenization aims to learn discrete syllabic tokens that capture latent linguistic content-related structure from raw speech. Recent syllabic tokenization methods employ teacher-student distillation of the pretrained HuBERT to organize latent speech frame representations into syllabic segments. However, when trained with an utterance-level cross-entropy objective, the model predicts speaker identity rather than linguistic content, thereby compromising the purity of syllabic tokens. To address this problem, we propose a speaker-disentangled syllabic tokenizer that regresses speaker-perturbed student representations toward clean teacher targets within fixed-length chunks. Experimental results demonstrate that our proposed method achieves state-of-the-art performance in syllable boundary detection and syllabic segment clustering. Moreover, a speech language model trained on our syllabic tokens achieves a 7% relative improvement in syntactic and semantic understanding over the phone-level SpiRit-LM.