DSpark: Decodificação Especulativa com Agendamento de Confiança e Geração Semi-Autorregressiva
DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
July 6, 2026
Autores: Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang
cs.AI
Resumo
A decodificação especulativa acelera a inferência de Modelos de Linguagem de Grande Porte (LLMs) ao desacoplar a geração de rascunhos da verificação alvo. Embora rascunhadores paralelos recentes proponham eficientemente sequências longas de tokens em uma única passagem direta, eles sofrem com rápida degradação de aceitação devido à falta de dependências entre tokens. Além disso, verificar indiscriminadamente esses blocos estendidos desperdiça capacidade crítica do lote em tokens com alto risco de rejeição, degradando severamente a vazão em sistemas de atendimento de alta concorrência. Apresentamos o DSpark, um framework de decodificação especulativa que unifica a geração paralela de alta vazão com verificação adaptativa e consciente da carga. Para manter a qualidade do rascunho, o DSpark utiliza uma arquitetura semiautoregressiva, combinando um backbone paralelo com um módulo sequencial leve, para introduzir modelagem de dependências intrabloco e mitigar a degradação do sufixo. Para otimizar a eficiência do sistema, o DSpark emprega verificação agendada por confiança, ajustando dinamicamente o comprimento de verificação para cada requisição com base em probabilidades estimadas de sobrevivência do prefixo e perfis de vazão específicos do motor. Em benchmarks offline de diversos domínios, o DSpark melhora substancialmente o comprimento aceito em relação a rascunhadores autoregressivos e paralelos de última geração. Quando implantado no sistema de atendimento DeepSeek-V4 sob tráfego de usuários ao vivo, o DSpark consegue mitigar o desperdício de verificação. Em comparação com a linha de base de produção estabelecida (MTP-1), o DSpark acelera as velocidades de geração por usuário em 60 a 85 por cento em níveis de vazão equivalentes. Mais importante ainda, ao prevenir degradação severa da vazão sob restrições rigorosas de interatividade, ele possibilita níveis de desempenho anteriormente inatingíveis, deslocando a fronteira de Pareto do nosso sistema de atendimento.
English
Speculative decoding accelerates Large Language Model (LLM) inference by decoupling draft generation from target verification. While recent parallel drafters efficiently propose long token sequences in a single forward pass, they suffer from rapid acceptance decay due to a lack of inter-token dependencies. Furthermore, indiscriminately verifying these extended blocks wastes critical batch capacity on tokens with high rejection risks, severely degrading throughput in high-concurrency serving systems. We introduce DSpark, a speculative decoding framework that unifies high-throughput parallel generation with adaptive, load-aware verification. To maintain draft quality, DSpark utilizes a semi-autoregressive architecture, coupling a parallel backbone with a lightweight sequential module, to introduce intra-block dependency modeling and mitigate suffix decay. To optimize system efficiency, DSpark employs confidence-scheduled verification, dynamically tailoring the verification length for each request based on estimated prefix survival probabilities and engine-specific throughput profiles. On offline benchmarks across diverse domains, DSpark substantially improves the accepted length over state-of-the-art autoregressive and parallel drafters. When deployed within the DeepSeek-V4 serving system under live user traffic, DSpark successfully mitigates verification waste. Compared to the established production baseline (MTP-1), DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput levels. More importantly, by preventing severe throughput degradation under strict interactivity constraints, it enables performance tiers that were previously unattainable, shifting the Pareto frontier of our serving system.