Modelos de Linguagem de Fala Intercalados Trabalham Latentemente em Texto
Interleaved Speech Language Models Latently Work In Text
June 21, 2026
Autores: Talia Sternberg, Gallil Maimon, Yossi Adi
cs.AI
Resumo
Modelos de linguagem de fala (SLMs) têm sido amplamente estudados, com o paradigma comum incorporando dados de texto e LMs de texto pré-treinados. Uma abordagem principal é a intercalação de fala e texto, na qual os modelos são treinados em sequências contendo tanto tokens de fala quanto de texto, visando impulsionar até mesmo capacidades exclusivas de fala. No entanto, a forma como essas duas modalidades interagem no espaço latente do modelo permanece incerta. Neste trabalho, analisamos LMs intercalados de fala e texto de diferentes famílias e tamanhos de modelos através do escopo da lente logit para fornecer tal compreensão. Revelamos que esses modelos passam por uma fase de transcrição implícita na qual o token de texto da palavra falada se torna decodificável em camadas intermediárias, apesar de não serem treinados para reconhecimento de fala. A transcrição da palavra aparece como uma das principais palavras candidatas para até 77% dos dados. Após essa etapa, os modelos passam a prever a próxima palavra no espaço do texto antes de retornar ao domínio da fala. Finalmente, analisamos o papel dos dados de intercalação e da inicialização a partir de LMs de texto em induzir esse comportamento, bem como observamos como isso se correlaciona com habilidades de conhecimento falado. Nossa análise lança luz sobre os mecanismos internos subjacentes à relação entre as modalidades de fala e texto e pode moldar a otimização de SLMs.
English
Speech language models (SLMs) have been extensively studied, with the common paradigm incorporating text data and pre-trained text LMs. A leading approach is speech-text interleaving in which models are trained over sequences containing both speech and text tokens, aiming to boost even speech-only capabilities. Yet the way these two modalities interact in the model latent space remains unclear. In this work, we analyze interleaved speech-text LMs from different model families and sizes through the scope of the logit lens to provide such insight. We reveal that these models go through an implicit transcription phase in which the text token of the spoken word becomes decodable in intermediate layers, despite not being trained for speech recognition. The transcription of the word appears as one of the top candidate words for as much as 77\% of the data. Following this stage, the models proceed to predict the next word in the text space before transforming back to the speech domain. We finally analyze the role of interleaving data, and initializing from text LMs in eliciting this behavior, as well as seeing how this correlates with spoken knowledge abilities. Our analysis sheds light on the internal mechanisms underlying the relationship between speech and text modalities and could shape SLM optimization.