SlimSpec: Laagrang concept-LM-hoofd voor versnelde speculatieve decodering
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
May 11, 2026
Auteurs: Anton Plaksin, Sergei Krutikov, Sergei Skvortsov, Alexander Samarin
cs.AI
Samenvatting
Speculatieve decodering versnelt autoregressieve generatie in grote taalmodellen (Large Language Models, LLM's) via een tweestapsprocedure, waarbij een lichtgewicht draftmodel tokens voorstelt die het doelmodel vervolgens in één enkele forward pass verifieert. Hoewel het drafternetwerk klein is in moderne architecturen, voert de LM-head ervan nog steeds projectie uit naar een grote vocabulaire, wat een van de belangrijkste computationele knelpunten wordt. In eerder werk werd dit probleem voornamelijk aangepakt via statische of dynamische vocabulairtruncatie. Hoewel deze methoden het knelpunt verminderen, brengen ze extra complexiteit met zich mee, zoals speciale vocabulaircuratie, geavanceerde logica tijdens inferentie of aanpassingen van de trainingsopzet. In dit artikel stellen we SlimSpec voor, een lagerangparametrisering van de LM-head van de drafter die de interne representatie comprimeert in plaats van de uitvoer, met behoud van volledige vocabulaireondersteuning. We evalueren onze methode met de EAGLE-3-drafter over drie doelmodellen en diverse benchmarks in zowel latentie- als doorvoergebonden inferentietoestanden. SlimSpec behaalt een versnelling van 4 tot 5 keer ten opzichte van de standaard LM-head-architectuur, terwijl het een concurrerende acceptatielengte handhaaft, en overtreft bestaande methoden met tot wel 8–9% van de end-to-end-versnelling. Onze methode vereist minimale aanpassingen van de trainings- en inferentiepijplijnen. In combinatie met de eerdergenoemde versnellingsverbeteringen maakt dit SlimSpec tot een sterk alternatief voor een breed scala aan draft-LM-head-architecturen.
English
Speculative decoding speeds up autoregressive generation in Large Language Models (LLMs) through a two-step procedure, where a lightweight draft model proposes tokens which the target model then verifies in a single forward pass. Although the drafter network is small in modern architectures, its LM-head still performs projection to a large vocabulary, becoming one of the major computational bottlenecks. In prior work this issue has been predominantly addressed via static or dynamic vocabulary truncation. Yet mitigating the bottleneck, these methods bring in extra complexity, such as special vocabulary curation, sophisticated inference-time logic or modifications of the training setup. In this paper, we propose SlimSpec, a low-rank parameterization of the drafter's LM-head that compresses the inner representation rather than the output, preserving full vocabulary support. We evaluate our method with EAGLE-3 drafter across three target models and diverse benchmarks in both latency- and throughput-bound inference regimes. SlimSpec achieves 4-5times acceleration over the standard LM-head architecture while maintaining a competitive acceptance length, surpassing existing methods by up to 8-9% of the end-to-end speedup. Our method requires minimal adjustments of training and inference pipelines. Combined with the aforementioned speedup improvements, it makes SlimSpec a strong alternative across wide variety of draft LM-head architectures.