DSpark: Vertrouwensgeplande speculatieve decodering met semi-autoregressieve generatie
DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
July 6, 2026
Auteurs: Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang
cs.AI
Samenvatting
Speculatieve decodering versnelt de inferentie van grote taalmodellen (LLM's) door het genereren van concepten los te koppelen van de doelverificatie. Hoewel recente parallelle conceptgeneratoren efficiënt lange tokenreeksen in één enkele voorwaartse pas voorstellen, lijden ze onder een snelle acceptatieafname door een gebrek aan onderlinge tokenafhankelijkheden. Bovendien verspilt het onderscheidloos verifiëren van deze uitgebreide blokken kritieke batchcapaciteit aan tokens met een hoog afwijzingsrisico, wat de doorvoer in systemen met hoge gelijktijdigheid ernstig aantast. We introduceren DSpark, een speculatief decoderingsraamwerk dat parallelle generatie met hoge doorvoer verenigt met adaptieve, belastingsbewuste verificatie. Om de conceptkwaliteit te behouden, maakt DSpark gebruik van een semi-autoregressieve architectuur, waarbij een parallelle backbone wordt gekoppeld aan een lichtgewicht sequentiële module, om intra-blok afhankelijkheidsmodellering te introduceren en suffixverval te beperken. Om de systeemefficiëntie te optimaliseren, past DSpark een vertrouwensgeplande verificatie toe, waarbij de verificatielengte voor elk verzoek dynamisch wordt aangepast op basis van geschatte prefixoverlevingskansen en motorspecifieke doorvoerprofielen. Op offline benchmarks in diverse domeinen verbetert DSpark de geaccepteerde lengte aanzienlijk ten opzichte van state-of-the-art autoregressieve en parallelle conceptgeneratoren. Wanneer het wordt ingezet in het DeepSeek-V4 serveersysteem onder live gebruikersverkeer, beperkt DSpark met succes verificatieverspilling. Vergeleken met de gevestigde productiebaseline (MTP-1) versnelt DSpark de generatiesnelheden per gebruiker met 60 tot 85 procent bij overeenkomende doorvoerniveaus. Belangrijker nog, door ernstige doorvoerverslechtering onder strikte interactiviteitsbeperkingen te voorkomen, maakt het prestatieniveaus mogelijk die voorheen onbereikbaar waren, waardoor de Pareto-grens van ons serveersysteem verschuift.
English
Speculative decoding accelerates Large Language Model (LLM) inference by decoupling draft generation from target verification. While recent parallel drafters efficiently propose long token sequences in a single forward pass, they suffer from rapid acceptance decay due to a lack of inter-token dependencies. Furthermore, indiscriminately verifying these extended blocks wastes critical batch capacity on tokens with high rejection risks, severely degrading throughput in high-concurrency serving systems. We introduce DSpark, a speculative decoding framework that unifies high-throughput parallel generation with adaptive, load-aware verification. To maintain draft quality, DSpark utilizes a semi-autoregressive architecture, coupling a parallel backbone with a lightweight sequential module, to introduce intra-block dependency modeling and mitigate suffix decay. To optimize system efficiency, DSpark employs confidence-scheduled verification, dynamically tailoring the verification length for each request based on estimated prefix survival probabilities and engine-specific throughput profiles. On offline benchmarks across diverse domains, DSpark substantially improves the accepted length over state-of-the-art autoregressive and parallel drafters. When deployed within the DeepSeek-V4 serving system under live user traffic, DSpark successfully mitigates verification waste. Compared to the established production baseline (MTP-1), DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput levels. More importantly, by preventing severe throughput degradation under strict interactivity constraints, it enables performance tiers that were previously unattainable, shifting the Pareto frontier of our serving system.