DSpark : Décodage Spéculatif à Planification de Confiance avec Génération Semi-Autorégressive
DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
July 6, 2026
Auteurs: Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang
cs.AI
Résumé
Le décodage spéculatif accélère l'inférence des Grands Modèles de Langage (LLM) en découplant la génération d'ébauches de la vérification cible. Bien que les récents rédacteurs parallèles proposent efficacement de longues séquences de tokens en une seule passe avant, ils souffrent d'une diminution rapide de l'acceptation en raison de l'absence de dépendances inter-tokens. De plus, vérifier indistinctement ces blocs étendus gaspille une capacité de lot critique sur des tokens présentant des risques de rejet élevés, ce qui dégrade sévèrement le débit dans les systèmes de service à forte concurrence. Nous présentons DSpark, un framework de décodage spéculatif qui unifie la génération parallèle à haut débit avec une vérification adaptative et sensible à la charge. Pour maintenir la qualité des ébauches, DSpark utilise une architecture semi-autorégressive, associant un backbone parallèle à un module séquentiel léger, afin d'introduire une modélisation des dépendances intra-blocs et d'atténuer la dégradation des suffixes. Pour optimiser l'efficacité du système, DSpark emploie une vérification programmée par confiance, ajustant dynamiquement la longueur de vérification pour chaque requête en fonction des probabilités de survie estimées du préfixe et des profils de débit propres au moteur. Sur des benchmarks hors ligne couvrant divers domaines, DSpark améliore substantiellement la longueur acceptée par rapport aux rédacteurs autorégressifs et parallèles de pointe. Déployé dans le système de service DeepSeek-V4 sous trafic utilisateur réel, DSpark parvient à atténuer le gaspillage de vérification. Comparé à la base de production établie (MTP-1), DSpark accélère les vitesses de génération par utilisateur de 60 à 85 pour cent à des niveaux de débit équivalents. Plus important encore, en empêchant une grave dégradation du débit sous des contraintes d'interactivité strictes, il permet d'atteindre des niveaux de performance auparavant inaccessibles, déplaçant ainsi la frontière de Pareto de notre système de service.
English
Speculative decoding accelerates Large Language Model (LLM) inference by decoupling draft generation from target verification. While recent parallel drafters efficiently propose long token sequences in a single forward pass, they suffer from rapid acceptance decay due to a lack of inter-token dependencies. Furthermore, indiscriminately verifying these extended blocks wastes critical batch capacity on tokens with high rejection risks, severely degrading throughput in high-concurrency serving systems. We introduce DSpark, a speculative decoding framework that unifies high-throughput parallel generation with adaptive, load-aware verification. To maintain draft quality, DSpark utilizes a semi-autoregressive architecture, coupling a parallel backbone with a lightweight sequential module, to introduce intra-block dependency modeling and mitigate suffix decay. To optimize system efficiency, DSpark employs confidence-scheduled verification, dynamically tailoring the verification length for each request based on estimated prefix survival probabilities and engine-specific throughput profiles. On offline benchmarks across diverse domains, DSpark substantially improves the accepted length over state-of-the-art autoregressive and parallel drafters. When deployed within the DeepSeek-V4 serving system under live user traffic, DSpark successfully mitigates verification waste. Compared to the established production baseline (MTP-1), DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput levels. More importantly, by preventing severe throughput degradation under strict interactivity constraints, it enables performance tiers that were previously unattainable, shifting the Pareto frontier of our serving system.