ChatPaper.aiChatPaper

Segmentação e Reconhecimento de Fones através de Mapeamento de Ativação Fonológica

Phone Segmentation and Recognition through Phonological Activation Mapping

July 10, 2026
Autores: Shikhar Bharadwaj, Kwanghee Choi, Stephen McIntosh, Chin-Jou Li, Eunjung Yeo, Daisuke Saito, Nobuaki Minematsu, Shinji Watanabe, Jian Zhu, David Harwath, David R. Mortensen
cs.AI

Resumo

Segmentação e reconhecimento de fones são tarefas intrinsecamente relacionadas, porém abordagens modernas geralmente as modelam separadamente. Argumentamos que a estrutura fonética já está latente nas representações de modelos de fala auto-supervisionados (S3Ms), sendo necessário apenas orientá-los para resolver ambas as tarefas. Utilizamos o Mapeamento de Ativação Fonológica baseado em S3M (SPAM), que mapeia cada quadro da representação do S3M para um vetor de ativações de características fonológicas, como sonoridade e nasalidade. Sobre o SPAM, introduzimos duas cabeças de predição leves, simples e eficazes, sem necessidade de gradiente descendente: uma cabeça de reconhecimento e uma cabeça de segmentação. Nosso método requer menos de um minuto de transcrições fonéticas e generaliza para fones não vistos durante o treinamento. Em um conjunto diversificado de bases de dados, nossa abordagem alcança desempenho robusto tanto em segmentação quanto em reconhecimento.
English
Phone segmentation and recognition are inherently related tasks, yet modern approaches typically model them separately. We argue that phonetic structure is already latent in the representations of self-supervised speech models (S3Ms), and one only needs to steer them to solve both tasks. We leverage S3M-based Phonological Activation Mapping (SPAM), which maps each S3M representation frame to a vector of phonological feature activations, such as voicing and nasality. On top of SPAM, we introduce two simple but effective lightweight, gradient-descent-free prediction heads: a recognition head and a segmentation head. Our method requires less than a minute of phonetic transcriptions, and generalizes to unseen phones during training. Across a diverse range of datasets, our approach attains strong segmentation and recognition performance.