FlexiSLM: Um Modelo de Linguagem Falada com Taxa de Quadros Dinâmica e Controlável
FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model
June 30, 2026
Autores: Jiaqi Li, Chaoren Wang, Xiaohai Tian, Mingjie Chen, Xinyu Liang, Xu Li, Yufan Lin, Junwen Qiu, Jun Zhang, Lu Lu, Haizhou Li, Zhizheng Wu
cs.AI
Resumo
Modelos de linguagem falada (SLMs) estendem LLMs para entrada e saída de fala. SLMs existentes representam a fala em taxas de quadros fixas (por exemplo, 25 ou 12,5 Hz), ignorando a densidade de informação variável no tempo da fala e não oferecendo flexibilidade para equilibrar qualidade e velocidade no momento da inferência. Pesquisas recentes sobre tokenizadores de áudio propuseram codificação de fala com taxa de quadros dinâmica, que explora essa não uniformidade e viabiliza duas novas capacidades: taxas de quadros médias muito baixas e controlabilidade da taxa de quadros. No entanto, essa técnica ainda não foi aplicada a SLMs. Apresentamos o Modelo de Linguagem Falada Flexível (FlexiSLM), o primeiro SLM que suporta taxas de quadros dinâmicas e controláveis tanto na entrada quanto na saída de fala. Usando representações de taxa de quadros dinâmica, o FlexiSLM supera modelos de 7B com taxas de quadros fixas, incluindo Qwen2.5-Omni e Kimi-Audio, em seus pontos operacionais de alta qualidade. Verificamos ainda que o FlexiSLM pode ser direcionado com precisão para até 4,0 Hz; a 6,25 Hz, ele reduz aproximadamente pela metade o tempo de inferência em relação a 12,5 Hz, mantendo uma forte qualidade de fala para fala. Amostras de áudio estão disponíveis em https://flexislm.github.io .
English
Spoken language models (SLMs) extend LLMs to speech input and output. Existing SLMs represent speech at fixed frame rates (e.g., 25 or 12.5 Hz), ignoring the time-varying information density of speech and offering no flexibility to trade off quality for speed at inference time. Recent audio tokenizer research has proposed dynamic frame rate speech coding, which exploits this non-uniformity and enables two new capabilities: very low average frame rates and frame rate controllability. However, this technique has not yet been applied to SLMs. We introduce Flexible Spoken Language Model (FlexiSLM), the first SLM that supports dynamic and controllable frame rates on both speech input and output. Using dynamic frame rate representations, FlexiSLM outperforms fixed-frame-rate 7B models including Qwen2.5-Omni and Kimi-Audio at its high-quality operating points. We further verify that FlexiSLM can be accurately steered down to 4.0 Hz; at 6.25 Hz, it roughly halves inference time relative to 12.5 Hz while retaining strong speech-to-speech quality. Audio samples are available at https://flexislm.github.io .