ChatPaper.aiChatPaper

Transformador Latente de Byte Rápido

Fast Byte Latent Transformer

May 8, 2026
Autores: Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, Srinivasan Iyer
cs.AI

Resumo

Os modelos linguísticos de nível de byte (LMs) recentes equiparam o desempenho dos modelos de nível de token sem depender de vocabulários de subpalavras, mas sua utilidade é limitada pela geração autoregressiva lenta, byte a byte. Nós abordamos esse gargalo no Byte Latent Transformer (BLT) por meio de novas técnicas de treinamento e geração. Primeiro, introduzimos o BLT Diffusion (BLT-D), um novo modelo e nossa variante mais rápida do BLT, treinada com um objetivo auxiliar de difusão em blocos, além da função de perda padrão de previsão do próximo byte. Isso possibilita um procedimento de inferência que gera vários bytes em paralelo por etapa de decodificação, reduzindo substancialmente o número de passagens diretas necessárias para gerar uma sequência. Segundo, propomos duas extensões inspiradas na decodificação especulativa que trocam parte dessa velocidade por maior qualidade de geração: o BLT Self-speculation (BLT-S), no qual o decodificador local do BLT continua gerando além de seus limites normais de fragmentos para rascunhar bytes, que são então verificados com uma única passagem direta do modelo completo; e o BLT Diffusion+Verification (BLT-DV), que aprimora o BLT-D com uma etapa de verificação autoregressiva após a geração baseada em difusão. Todos os métodos podem alcançar um custo estimado de largura de banda de memória mais de 50% menor que o BLT em tarefas de geração. Cada abordagem oferece suas próprias vantagens únicas, eliminando conjuntamente barreiras-chave para o uso prático de LMs de nível de byte.
English
Recent byte-level language models (LMs) match the performance of token-level models without relying on subword vocabularies, yet their utility is limited by slow, byte-by-byte autoregressive generation. We address this bottleneck in the Byte Latent Transformer (BLT) through new training and generation techniques. First, we introduce BLT Diffusion (BLT-D), a new model and our fastest BLT variant, trained with an auxiliary block-wise diffusion objective alongside the standard next-byte prediction loss. This enables an inference procedure that generates multiple bytes in parallel per decoding step, substantially reducing the number of forward passes required to generate a sequence. Second, we propose two extensions inspired by speculative decoding that trade some of this speed for higher generation quality: BLT Self-speculation (BLT-S), in which BLT's local decoder continues generating past its normal patch boundaries to draft bytes, which are then verified with a single full-model forward pass; and BLT Diffusion+Verification (BLT-DV), which augments BLT-D with an autoregressive verification step after diffusion-based generation. All methods may achieve an estimated memory-bandwidth cost over 50% lower than BLT on generation tasks. Each approach offers its own unique advantages, together removing key barriers to the practical use of byte-level LMs.