ChatPaper.aiChatPaper

Segmentation et reconnaissance de phones par cartographie d'activation phonologique

Phone Segmentation and Recognition through Phonological Activation Mapping

July 10, 2026
Auteurs: Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh, Chin-Jou Li, Eunjung Yeo, Daisuke Saito, Nobuaki Minematsu, Shinji Watanabe, Jian Zhu, David Harwath, David R. Mortensen
cs.AI

Résumé

La segmentation et la reconnaissance des phones sont des tâches intrinsèquement liées, mais les approches modernes les modélisent généralement séparément. Nous soutenons que la structure phonétique est déjà latente dans les représentations des modèles de parole auto-supervisés (S3M), et qu'il suffit de les orienter pour résoudre les deux tâches. Nous exploitons la cartographie d'activation phonologique basée sur les S3M (SPAM), qui associe chaque trame de représentation d'un S3M à un vecteur d'activations de traits phonologiques, tels que le voisement et la nasalité. À partir de SPAM, nous introduisons deux têtes de prédiction simples mais efficaces, légères et sans descente de gradient : une tête de reconnaissance et une tête de segmentation. Notre méthode nécessite moins d'une minute de transcriptions phonétiques et généralise aux phones non vus lors de l'entraînement. Sur un ensemble diversifié de jeux de données, notre approche obtient de solides performances en segmentation et en reconnaissance.
English
Phone segmentation and recognition are inherently related tasks, yet modern approaches typically model them separately. We argue that phonetic structure is already latent in the representations of self-supervised speech models (S3Ms), and one only needs to steer them to solve both tasks. We leverage S3M-based Phonological Activation Mapping (SPAM), which maps each S3M representation frame to a vector of phonological feature activations, such as voicing and nasality. On top of SPAM, we introduce two simple but effective lightweight, gradient-descent-free prediction heads: a recognition head and a segmentation head. Our method requires less than a minute of phonetic transcriptions, and generalizes to unseen phones during training. Across a diverse range of datasets, our approach attains strong segmentation and recognition performance.