ChatPaper.aiChatPaper

Interleaved spraaktaalmodellen werken latent in tekst.

Interleaved Speech Language Models Latently Work In Text

June 21, 2026
Auteurs: Talia Sternberg, Gallil Maimon, Yossi Adi
cs.AI

Samenvatting

Spraaktaalmodellen (SLM's) zijn uitgebreid bestudeerd, waarbij het gangbare paradigma tekstgegevens en voorgetrainde tekst-LM's omvat. Een toonaangevende benadering is spraak-tekstverweving, waarbij modellen worden getraind op reeksen die zowel spraak- als teksttokens bevatten, met als doel zelfs spraak-only mogelijkheden te verbeteren. De manier waarop deze twee modaliteiten in de latente ruimte van het model interacteren blijft echter onduidelijk. In dit werk analyseren we verweven spraak-tekst-LM's uit verschillende modelfamilies en -groottes door de lens van de logitlens om dergelijk inzicht te verschaffen. We onthullen dat deze modellen een impliciete transcriptiefase doorlopen waarin het teksttoken van het gesproken woord decodeerbaar wordt in tussenliggende lagen, ondanks dat ze niet zijn getraind voor spraakherkenning. De transcriptie van het woord verschijnt als een van de topkandidaatwoorden voor maar liefst 77% van de gegevens. Na deze fase gaan de modellen over tot het voorspellen van het volgende woord in de tekstruimte, alvorens terug te transformeren naar het spraakdomein. Ten slotte analyseren we de rol van verwevingsgegevens en het initialiseren vanuit tekst-LM's bij het opwekken van dit gedrag, en zien we hoe dit correleert met gesproken kennisvaardigheden. Onze analyse werpt licht op de interne mechanismen die ten grondslag liggen aan de relatie tussen spraak- en tekstmodaliteiten en zou de optimalisatie van SLM's kunnen vormgeven.
English
Speech language models (SLMs) have been extensively studied, with the common paradigm incorporating text data and pre-trained text LMs. A leading approach is speech-text interleaving in which models are trained over sequences containing both speech and text tokens, aiming to boost even speech-only capabilities. Yet the way these two modalities interact in the model latent space remains unclear. In this work, we analyze interleaved speech-text LMs from different model families and sizes through the scope of the logit lens to provide such insight. We reveal that these models go through an implicit transcription phase in which the text token of the spoken word becomes decodable in intermediate layers, despite not being trained for speech recognition. The transcription of the word appears as one of the top candidate words for as much as 77\% of the data. Following this stage, the models proceed to predict the next word in the text space before transforming back to the speech domain. We finally analyze the role of interleaving data, and initializing from text LMs in eliciting this behavior, as well as seeing how this correlates with spoken knowledge abilities. Our analysis sheds light on the internal mechanisms underlying the relationship between speech and text modalities and could shape SLM optimization.