ChatPaper.aiChatPaper

Scratchpad Patching : découpler le calcul de la taille des patchs dans les modèles de langage au niveau des octets

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

May 10, 2026
Auteurs: Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez
cs.AI

Résumé

Les modèles de langage sans tokeniseur éliminent l'étape de tokenisation du pipeline de modélisation du langage en opérant directement sur les octets ; les variantes basées sur des patches agrègent en outre des séquences d'octets contigus en patches pour plus d'efficacité. Cependant, la taille moyenne des patches choisie lors de la conception du modèle régit un compromis serré : des patches plus grands réduisent la charge de calcul et l'empreinte du cache KV, mais dégradent la qualité de modélisation. Nous attribuons ce compromis au décalage de patch : jusqu'à ce qu'un patch soit entièrement observé, les prédictions d'octets à l'intérieur de celui-ci doivent s'appuyer sur une représentation obsolète du patch précédent pour préserver la causalité ; ce décalage s'accroît à mesure que les patches deviennent plus grands. Nous introduisons le Patchage par Bloc-notes (Scratchpad Patching, SP), qui insère des blocs-notes transitoires à l'intérieur de chaque patch pour agréger les octets déjà vus et rafraîchir le contexte au niveau du patch pour les prédictions ultérieures. SP déclenche les blocs-notes en utilisant l'entropie de prédiction du prochain octet, allouant sélectivement le calcul aux régions denses en information et permettant un ajustement a posteriori du calcul au moment de l'inférence. À travers des expériences sur le langage naturel et le code, SP améliore la qualité du modèle à la même taille de patch ; par exemple, même à 16 octets par patch, les modèles augmentés par SP égalent ou s'approchent étroitement de la référence au niveau des octets dans les évaluations en aval, tout en utilisant un cache KV 16 fois plus petit pour les patches et 3 à 4 fois moins de calcul d'inférence.
English
Tokenizer-free language models eliminate the tokenizer step of the language modeling pipeline by operating directly on bytes; patch-based variants further aggregate contiguous byte spans into patches for efficiency. However, the average patch size chosen at the model design stage governs a tight trade-off: larger patches reduce compute and KV-cache footprint, but degrade modeling quality. We trace this trade-off to patch lag: until a patch is fully observed, byte predictions within it must rely on a stale representation from the previous patch to preserve causality; this lag widens as patches grow larger. We introduce Scratchpad Patching (SP), which inserts transient scratchpads inside each patch to aggregate the bytes seen so far and refresh patch-level context for subsequent predictions. SP triggers scratchpads using next-byte prediction entropy, selectively allocating compute to information-dense regions and enabling post-hoc adjustment of inference-time compute. Across experiments on natural language and code, SP improves model quality at the same patch size; for example, even at 16 bytes per patch, SP-augmented models match or closely approach the byte-level baseline on downstream evaluations while using a 16times smaller KV cache over patches and 3-4times less inference compute.