ChatPaper.aiChatPaper

SpecBlock: Decodificação Especulativa Iterativa por Blocos com Rascunho Dinâmico de Árvore

SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting

May 8, 2026
Autores: Weijie Shi, Qiang Xu, Fan Deng, Yaguang Wu, Jiarun Liu, Yehong Xu, Hao Chen, Jia Zhu, Jiajie Xu, Xiangjun Huang, Jian Yang, Xiaofang Zhou
cs.AI

Resumo

A decodificação especulativa acelera a inferência de LLM ao esboçar uma árvore de continuações candidatas e verificá-la em uma passagem direta do modelo alvo. Os esboçadores existentes se dividem em duas categorias com pontos fracos opostos. Esboçadores autorregressivos, como o EAGLE-3, preservam a dependência ao longo de cada caminho de esboço, mas chamam o esboçador uma vez por profundidade da árvore, fazendo com que o esboço represente uma parcela não trivial da latência por iteração. Esboçadores paralelos reduzem as chamadas ao esboçador ao prever múltiplas posições futuras em uma única passagem direta, mas cada posição é prevista sem ver as outras, produzindo caminhos que o verificador rejeita. Neste artigo, propomos o SpecBlock, um esboçador iterativo por blocos que combina dependência de caminho com esboço de baixo custo. Cada passagem direta do esboçador produz K posições dependentes, e denominamos isso um bloco. A árvore de esboço cresce por meio de expansões repetidas de blocos. Dois mecanismos carregam explicitamente a dependência de caminho para manter as posições de esboço posteriores precisas. Dentro de cada bloco, um deslocamento por camada transporta o estado oculto da posição anterior para cada camada do decodificador. Entre blocos, cada novo bloco pode começar a partir de qualquer posição do bloco anterior, herdando seu estado oculto para estender o caminho. Para gastar o orçamento do verificador onde a aceitação é provável, uma cabeça de classificação co-treinada substitui a árvore top-k fixa ao alocar ramificações por posição durante o esboço. Para evitar treinar o esboçador em prefixos que ele nunca produz na inferência, uma máscara de prefixo válido descarta a perda em posições posteriores assim que uma anterior estiver incorreta. Além do esboço estático, um bandido ciente de custo em implantação usa o feedback gratuito do verificador para atualizar o esboçador seletivamente, apenas quando o ganho esperado de vazão excede o custo da atualização. Experimentos mostram que o SpecBlock melhora a aceleração média em 8-13% em relação ao EAGLE-3, com 44-52% do custo de esboço deste, e a adaptação ciente de custo estende essa vantagem para 11-19%.
English
Speculative decoding accelerates LLM inference by drafting a tree of candidate continuations and verifying it in one target forward. Existing drafters fall into two camps with opposite weaknesses. Autoregressive drafters such as EAGLE-3 preserve dependence along each draft path but call the drafter once per tree depth, making drafting a non-trivial share of per-iteration latency. Parallel drafters cut drafter calls by predicting multiple future positions in one forward, but each position is predicted without seeing the others, producing paths the verifier rejects. In this paper, we propose SpecBlock, a block-iterative drafter that combines path dependence with cheap drafting. Each drafter forward produces K dependent positions and we call this a block. The draft tree grows through repeated block expansions. Two mechanisms explicitly carry path dependence to keep later draft positions accurate. Within each block, a layer-wise shift carries the previous position's hidden state into every decoder layer. Across blocks, each new block can start from any position of the previous block, inheriting its hidden state to extend the path. To spend verifier budget where acceptance is likely, a co-trained rank head replaces the fixed top-k tree by allocating per-position branching during drafting. To avoid training the drafter on prefixes it never produces at inference, a valid-prefix mask drops the loss at later positions once an earlier one is wrong. Beyond static drafting, a cost-aware bandit at deployment uses free verifier feedback to update the drafter selectively, only when the expected throughput gain exceeds the update cost. Experiments show that SpecBlock improves mean speedup by 8-13% over EAGLE-3 at 44-52% of its drafting cost, and cost-aware adaptation extends this lead to 11-19%.