FlexiSLM: Een dynamisch en controleerbaar spraaktaalmodel met variabele framesnelheid
FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model
June 30, 2026
Auteurs: Jiaqi Li, Chaoren Wang, Xiaohai Tian, Mingjie Chen, Xinyu Liang, Xu Li, Yufan Lin, Junwen Qiu, Jun Zhang, Lu Lu, Haizhou Li, Zhizheng Wu
cs.AI
Samenvatting
Gesproken taalmodellen (SLM's) breiden LLM's uit naar spraakinvoer en -uitvoer. Bestaande SLM's representeren spraak met vaste framesnelheden (bijv. 25 of 12,5 Hz), waarbij ze de tijdsvariërende informatiedichtheid van spraak negeren en geen flexibiliteit bieden om kwaliteit in te ruilen voor snelheid tijdens inferentie. Recent onderzoek naar audio-tokenizers heeft dynamische framesnelheidscodering voor spraak voorgesteld, die deze niet-uniformiteit benut en twee nieuwe mogelijkheden biedt: zeer lage gemiddelde framesnelheden en beheersbaarheid van de framesnelheid. Deze techniek is echter nog niet toegepast op SLM's. Wij introduceren het Flexible Spoken Language Model (FlexiSLM), het eerste SLM dat dynamische en beheersbare framesnelheden ondersteunt voor zowel spraakinvoer als -uitvoer. Met behulp van dynamische framesnelheidsrepresentaties overtreft FlexiSLM vaste-framesnelheid 7B-modellen, waaronder Qwen2.5-Omni en Kimi-Audio, op zijn hoogwaardige werkpunten. We verifiëren verder dat FlexiSLM nauwkeurig kan worden gestuurd tot 4,0 Hz; bij 6,25 Hz halveert het ongeveer de inferentietijd ten opzichte van 12,5 Hz, terwijl het een sterke spraak-naar-spraakkwaliteit behoudt. Audiovoorbeelden zijn beschikbaar op https://flexislm.github.io.
English
Spoken language models (SLMs) extend LLMs to speech input and output. Existing SLMs represent speech at fixed frame rates (e.g., 25 or 12.5 Hz), ignoring the time-varying information density of speech and offering no flexibility to trade off quality for speed at inference time. Recent audio tokenizer research has proposed dynamic frame rate speech coding, which exploits this non-uniformity and enables two new capabilities: very low average frame rates and frame rate controllability. However, this technique has not yet been applied to SLMs. We introduce Flexible Spoken Language Model (FlexiSLM), the first SLM that supports dynamic and controllable frame rates on both speech input and output. Using dynamic frame rate representations, FlexiSLM outperforms fixed-frame-rate 7B models including Qwen2.5-Omni and Kimi-Audio at its high-quality operating points. We further verify that FlexiSLM can be accurately steered down to 4.0 Hz; at 6.25 Hz, it roughly halves inference time relative to 12.5 Hz while retaining strong speech-to-speech quality. Audio samples are available at https://flexislm.github.io .