ChatPaper.aiChatPaper

Scratchpad-patching: Ontkoppeling van computatie en patchgrootte in taalmodellen op byteniveau

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

May 10, 2026
Auteurs: Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez
cs.AI

Samenvatting

Tokenizer-vrije taalmodellen elimineren de tokenizerstap van de taalmodelleringspijplijn door direct op bytes te werken; patch-gebaseerde varianten aggregeren verdere aaneengesloten byte-reeksen in patches voor efficiëntie. Echter, de gemiddelde patchgrootte die bij het modelontwerp wordt gekozen, bepaalt een strakke afweging: grotere patches verminderen de rekenlast en KV-cache-voetafdruk, maar verslechteren de modelkwaliteit. We herleiden deze afweging tot patch-achterstand: totdat een patch volledig is waargenomen, moeten byte-voorspellingen erbinnen vertrouwen op een verouderde representatie van de vorige patch om causaliteit te behouden; deze achterstand wordt groter naarmate patches groter worden. We introduceren Scratchpad Patching (SP), dat tijdelijke scratchpads in elke patch invoegt om de tot nu toe geziene bytes te aggregeren en de patch-niveau context voor volgende voorspellingen te vernieuwen. SP activeert scratchpads met behulp van volgende-byte voorspellingsentropie, waarbij selectief rekenkracht wordt toegewezen aan informatie-dichte regio's en aanpassing achteraf van rekenkracht tijdens inferentie mogelijk wordt. In experimenten met natuurlijke taal en code verbetert SP de modelkwaliteit bij dezelfde patchgrootte; bijvoorbeeld, zelfs bij 16 bytes per patch, evenaren of benaderen SP-verbeterde modellen de byte-niveau baseline bij downstream-evaluaties, terwijl ze een 16 keer kleinere KV-cache over patches en 3-4 keer minder inferentie-rekenkracht gebruiken.
English
Tokenizer-free language models eliminate the tokenizer step of the language modeling pipeline by operating directly on bytes; patch-based variants further aggregate contiguous byte spans into patches for efficiency. However, the average patch size chosen at the model design stage governs a tight trade-off: larger patches reduce compute and KV-cache footprint, but degrade modeling quality. We trace this trade-off to patch lag: until a patch is fully observed, byte predictions within it must rely on a stale representation from the previous patch to preserve causality; this lag widens as patches grow larger. We introduce Scratchpad Patching (SP), which inserts transient scratchpads inside each patch to aggregate the bytes seen so far and refresh patch-level context for subsequent predictions. SP triggers scratchpads using next-byte prediction entropy, selectively allocating compute to information-dense regions and enabling post-hoc adjustment of inference-time compute. Across experiments on natural language and code, SP improves model quality at the same patch size; for example, even at 16 bytes per patch, SP-augmented models match or closely approach the byte-level baseline on downstream evaluations while using a 16times smaller KV cache over patches and 3-4times less inference compute.