ChatPaper.aiChatPaper

DSpark: Спекулятивное декодирование с планированием на основе уверенности и полуавторегрессивной генерацией

DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation

July 6, 2026
Авторы: Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang
cs.AI

Аннотация

Спекулятивное декодирование ускоряет инференцию больших языковых моделей (LLM) за счет разделения генерации черновиков и верификации целей. Хотя современные параллельные генераторы черновиков эффективно предлагают длинные токеновые последовательности за один прямой проход, они страдают от быстрого ухудшения принятия из-за отсутствия межтокенных зависимостей. Более того, неизбирательная верификация этих расширенных блоков расходует критическую пропускную способность пакетной обработки на токены с высоким риском отклонения, что резко ухудшает пропускную способность в системах с высокой конкурентностью запросов. Мы представляем DSpark — фреймворк спекулятивного декодирования, объединяющий высокопроизводительную параллельную генерацию с адаптивной верификацией, учитывающей нагрузку. Для поддержания качества черновиков DSpark использует полуавторегрессионную архитектуру, сочетающую параллельный базовый модуль с легковесным последовательным модулем, что обеспечивает моделирование внутриблочных зависимостей и снижает ухудшение суффикса. Для оптимизации эффективности системы DSpark применяет верификацию с планированием на основе уровня уверенности, динамически подбирая длину верификации для каждого запроса в зависимости от предполагаемых вероятностей выживания префикса и профилей пропускной способности конкретного движка. На автономных бенчмарках из различных доменов DSpark существенно улучшает принятую длину по сравнению с современными авторегрессионными и параллельными генераторами черновиков. При развертывании в системе обслуживания DeepSeek-V4 в условиях реального пользовательского трафика DSpark успешно снижает потери на верификацию. По сравнению с установленным производственным базовым уровнем (MTP-1), DSpark ускоряет генерацию для каждого пользователя на 60–85 процентов при одинаковых уровнях пропускной способности. Более важно, что, предотвращая серьезное снижение пропускной способности при строгих ограничениях интерактивности, DSpark обеспечивает уровни производительности, ранее недостижимые, смещая границу Парето нашей системы обслуживания.
English
Speculative decoding accelerates Large Language Model (LLM) inference by decoupling draft generation from target verification. While recent parallel drafters efficiently propose long token sequences in a single forward pass, they suffer from rapid acceptance decay due to a lack of inter-token dependencies. Furthermore, indiscriminately verifying these extended blocks wastes critical batch capacity on tokens with high rejection risks, severely degrading throughput in high-concurrency serving systems. We introduce DSpark, a speculative decoding framework that unifies high-throughput parallel generation with adaptive, load-aware verification. To maintain draft quality, DSpark utilizes a semi-autoregressive architecture, coupling a parallel backbone with a lightweight sequential module, to introduce intra-block dependency modeling and mitigate suffix decay. To optimize system efficiency, DSpark employs confidence-scheduled verification, dynamically tailoring the verification length for each request based on estimated prefix survival probabilities and engine-specific throughput profiles. On offline benchmarks across diverse domains, DSpark substantially improves the accepted length over state-of-the-art autoregressive and parallel drafters. When deployed within the DeepSeek-V4 serving system under live user traffic, DSpark successfully mitigates verification waste. Compared to the established production baseline (MTP-1), DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput levels. More importantly, by preventing severe throughput degradation under strict interactivity constraints, it enables performance tiers that were previously unattainable, shifting the Pareto frontier of our serving system.