DSpark: Decodificación Especulativa Programada por Confianza con Generación Semi-Autorregresiva
DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
July 6, 2026
Autores: Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang
cs.AI
Resumen
La decodificación especulativa acelera la inferencia de los Modelos de Lenguaje Grandes (LLM) al desacoplar la generación de borradores de la verificación objetivo. Si bien los generadores de borradores paralelos recientes proponen de manera eficiente secuencias largas de tokens en una única pasada hacia adelante, sufren de una rápida degradación en la aceptación debido a la falta de dependencias entre tokens. Además, verificar indiscriminadamente estos bloques extendidos desperdicia capacidad crítica del lote en tokens con alto riesgo de rechazo, degradando gravemente el rendimiento en sistemas de servicio de alta concurrencia. Presentamos DSpark, un marco de decodificación especulativa que unifica la generación paralela de alto rendimiento con una verificación adaptativa y consciente de la carga. Para mantener la calidad del borrador, DSpark utiliza una arquitectura semiautoregresiva, que combina una columna vertebral paralela con un módulo secuencial ligero, para introducir el modelado de dependencias intrabloque y mitigar la degradación del sufijo. Para optimizar la eficiencia del sistema, DSpark emplea una verificación programada por confianza, ajustando dinámicamente la longitud de verificación para cada solicitud en función de las probabilidades de supervivencia del prefijo estimadas y los perfiles de rendimiento específicos del motor. En evaluaciones comparativas fuera de línea en diversos dominios, DSpark mejora sustancialmente la longitud aceptada en comparación con los generadores de borradores autoregresivos y paralelos de última generación. Cuando se implementa dentro del sistema de servicio DeepSeek-V4 bajo tráfico de usuarios en vivo, DSpark mitiga con éxito el desperdicio de verificación. En comparación con la línea base de producción establecida (MTP-1), DSpark acelera las velocidades de generación por usuario entre un 60 y un 85 por ciento en niveles de rendimiento igualados. Más importante aún, al prevenir una degradación severa del rendimiento bajo restricciones estrictas de interactividad, permite niveles de rendimiento previamente inalcanzables, desplazando la frontera de Pareto de nuestro sistema de servicio.
English
Speculative decoding accelerates Large Language Model (LLM) inference by decoupling draft generation from target verification. While recent parallel drafters efficiently propose long token sequences in a single forward pass, they suffer from rapid acceptance decay due to a lack of inter-token dependencies. Furthermore, indiscriminately verifying these extended blocks wastes critical batch capacity on tokens with high rejection risks, severely degrading throughput in high-concurrency serving systems. We introduce DSpark, a speculative decoding framework that unifies high-throughput parallel generation with adaptive, load-aware verification. To maintain draft quality, DSpark utilizes a semi-autoregressive architecture, coupling a parallel backbone with a lightweight sequential module, to introduce intra-block dependency modeling and mitigate suffix decay. To optimize system efficiency, DSpark employs confidence-scheduled verification, dynamically tailoring the verification length for each request based on estimated prefix survival probabilities and engine-specific throughput profiles. On offline benchmarks across diverse domains, DSpark substantially improves the accepted length over state-of-the-art autoregressive and parallel drafters. When deployed within the DeepSeek-V4 serving system under live user traffic, DSpark successfully mitigates verification waste. Compared to the established production baseline (MTP-1), DSpark accelerates per-user generation speeds by 60 to 85 percent at matched throughput levels. More importantly, by preventing severe throughput degradation under strict interactivity constraints, it enables performance tiers that were previously unattainable, shifting the Pareto frontier of our serving system.