ChatPaper.aiChatPaper

Сегментация и распознавание фонем посредством картирования фонологической активации

Phone Segmentation and Recognition through Phonological Activation Mapping

July 10, 2026
Авторы: Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh, Chin-Jou Li, Eunjung Yeo, Daisuke Saito, Nobuaki Minematsu, Shinji Watanabe, Jian Zhu, David Harwath, David R. Mortensen
cs.AI

Аннотация

Сегментация и распознавание фонем являются тесно связанными задачами, однако в современных подходах они обычно моделируются по отдельности. Мы утверждаем, что фонетическая структура уже латентно присутствует в представлениях самоконтролируемых речевых моделей (S3M), и необходимо лишь направить их на решение обеих задач. Мы используем фонологическое активационное картирование на базе S3M (SPAM), которое отображает каждый фрейм представления S3M в вектор активаций фонологических признаков, таких как звонкость и назальность. Поверх SPAM мы вводим две простые, но эффективные легковесные головки предсказания, не требующие градиентного спуска: головку распознавания и головку сегментации. Наш метод требует менее минуты фонетических транскрипций и обобщается на ненаблюдаемые во время обучения фонемы. На разнообразном наборе данных наш подход демонстрирует высокую производительность как в сегментации, так и в распознавании.
English
Phone segmentation and recognition are inherently related tasks, yet modern approaches typically model them separately. We argue that phonetic structure is already latent in the representations of self-supervised speech models (S3Ms), and one only needs to steer them to solve both tasks. We leverage S3M-based Phonological Activation Mapping (SPAM), which maps each S3M representation frame to a vector of phonological feature activations, such as voicing and nasality. On top of SPAM, we introduce two simple but effective lightweight, gradient-descent-free prediction heads: a recognition head and a segmentation head. Our method requires less than a minute of phonetic transcriptions, and generalizes to unseen phones during training. Across a diverse range of datasets, our approach attains strong segmentation and recognition performance.