ChatPaper.aiChatPaper

Aplicação de Patches em Scratchpad: Desacoplando Computação do Tamanho do Patch em Modelos de Linguagem de Nível de Byte

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

May 10, 2026
Autores: Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez
cs.AI

Resumo

Modelos de linguagem livres de tokenizador eliminam a etapa de tokenização do pipeline de modelagem de linguagem ao operar diretamente sobre bytes; variantes baseadas em patches agregam ainda mais spans contíguos de bytes em patches para eficiência. No entanto, o tamanho médio do patch escolhido na fase de projeto do modelo rege um compromisso restrito: patches maiores reduzem o custo computacional e o espaço ocupado pelo cache KV, mas degradam a qualidade da modelagem. Atribuímos esse compromisso ao atraso do patch: até que um patch seja totalmente observado, as predições de bytes dentro dele devem depender de uma representação desatualizada do patch anterior para preservar a causalidade; esse atraso aumenta à medida que os patches se tornam maiores. Apresentamos o Scratchpad Patching (SP), que insere scratchpads transitórios dentro de cada patch para agregar os bytes vistos até o momento e atualizar o contexto em nível de patch para predições subsequentes. O SP aciona scratchpads usando a entropia da predição do próximo byte, alocando seletivamente computação para regiões densas em informação e permitindo ajuste post-hoc da computação em tempo de inferência. Em experimentos com linguagem natural e código, o SP melhora a qualidade do modelo no mesmo tamanho de patch; por exemplo, mesmo com 16 bytes por patch, modelos aumentados com SP igualam ou se aproximam da linha de base em nível de byte em avaliações downstream, enquanto usam um cache KV 16 vezes menor sobre os patches e 3 a 4 vezes menos computação de inferência.
English
Tokenizer-free language models eliminate the tokenizer step of the language modeling pipeline by operating directly on bytes; patch-based variants further aggregate contiguous byte spans into patches for efficiency. However, the average patch size chosen at the model design stage governs a tight trade-off: larger patches reduce compute and KV-cache footprint, but degrade modeling quality. We trace this trade-off to patch lag: until a patch is fully observed, byte predictions within it must rely on a stale representation from the previous patch to preserve causality; this lag widens as patches grow larger. We introduce Scratchpad Patching (SP), which inserts transient scratchpads inside each patch to aggregate the bytes seen so far and refresh patch-level context for subsequent predictions. SP triggers scratchpads using next-byte prediction entropy, selectively allocating compute to information-dense regions and enabling post-hoc adjustment of inference-time compute. Across experiments on natural language and code, SP improves model quality at the same patch size; for example, even at 16 bytes per patch, SP-augmented models match or closely approach the byte-level baseline on downstream evaluations while using a 16times smaller KV cache over patches and 3-4times less inference compute.