ChatPaper.aiChatPaper

Segmentación y reconocimiento de fonos mediante mapeo de activación fonológica

Phone Segmentation and Recognition through Phonological Activation Mapping

July 10, 2026
Autores: Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh, Chin-Jou Li, Eunjung Yeo, Daisuke Saito, Nobuaki Minematsu, Shinji Watanabe, Jian Zhu, David Harwath, David R. Mortensen
cs.AI

Resumen

La segmentación y el reconocimiento de fonos son tareas inherentemente relacionadas; sin embargo, los enfoques modernos suelen modelarlas por separado. Sostenemos que la estructura fonética ya está latente en las representaciones de los modelos de habla autosupervisados (S3Ms), y que solo es necesario guiarlos para resolver ambas tareas. Aprovechamos el Mapeo de Activación Fonológica basado en S3Ms (SPAM), que asigna cada trama de representación del S3M a un vector de activaciones de rasgos fonológicos, como la sonoridad y la nasalidad. Sobre SPAM, introducimos dos cabezales de predicción ligeros, simples pero efectivos, que no requieren descenso de gradiente: un cabezal de reconocimiento y un cabezal de segmentación. Nuestro método requiere menos de un minuto de transcripciones fonéticas y se generaliza a fonos no vistos durante el entrenamiento. En un conjunto diverso de conjuntos de datos, nuestro enfoque logra un rendimiento sólido tanto en segmentación como en reconocimiento.
English
Phone segmentation and recognition are inherently related tasks, yet modern approaches typically model them separately. We argue that phonetic structure is already latent in the representations of self-supervised speech models (S3Ms), and one only needs to steer them to solve both tasks. We leverage S3M-based Phonological Activation Mapping (SPAM), which maps each S3M representation frame to a vector of phonological feature activations, such as voicing and nasality. On top of SPAM, we introduce two simple but effective lightweight, gradient-descent-free prediction heads: a recognition head and a segmentation head. Our method requires less than a minute of phonetic transcriptions, and generalizes to unseen phones during training. Across a diverse range of datasets, our approach attains strong segmentation and recognition performance.