ChatPaper.aiChatPaper

Plus intelligent et moins cher à la fois : le greffage de cache KV exact au niveau octet transforme un petit modèle gelé en un volant de connaissances vérifiées

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel

July 15, 2026
Auteurs: Sietse Schelpe
cs.AI

Résumé

Nous rapportons une méthode pour rendre un petit modèle de langage figé à la fois plus performant et considérablement moins coûteux, sans modifier aucun poids. Une connaissance vérifiée est déposée une fois sous forme d'artefact d'état clé-valeur (KV) exact au niveau de l'octet, puis restaurée, par greffe, dans un nouveau contexte d'inférence. La restauration est exacte au bit près : sous une configuration déterministe figée, les logits greffés sont identiques octet par octet à un calcul frais (égalité SHA-256), avec une divergence KL nulle et un accord argmax à 100 % sur cinquante échantillons. Nous montrons que la greffe en position propre est le seul point de fonctionnement numériquement exact sur un modèle doté d'un encodage rotatif en virgule flottante, et nous vérifions l'exactitude au niveau de l'octet sur deux échelles de modèle (12B, 31B) et deux cibles GPU, dont l'une via une relecture préenregistrée. Sur AIME 2025, un Gemma-4-12B figé passe de 80,0 % à 93,3 % une fois qu'une bibliothèque de solutions vérifiées est greffée, soit au-dessus de ses propres références publiées de 77,5 % et de celles de son homologue 31B à 89,2 %. Dans le cas récurrent, huit problèmes que le modèle de base ne résout jamais dans une limite de 401 026 tokens sont résolus à partir de solutions vérifiées mises en cache en 61 tokens de décodage au total, soit un facteur de 6 574 tokens de moins et environ 8 700 fois moins d'énergie ; la revendication de capacité repose proprement sur un transfert sur données retenues (7 sur 7 à 31B). Le même stockage exact au niveau de l'octet élargit le contexte utilisable de 32 768 à 2 854 766 tokens sans mémoire d'accélération supplémentaire, et se déplace de manière identique au niveau de l'octet entre machines de la même architecture. Nous décrivons le système au niveau comportemental ; le moteur est propriétaire, et chaque nombre rapporté est soutenu par des hachages d'entrée et de sortie engagés, de sorte que le score puisse être revérifié sans celui-ci.
English
We report a way to make a frozen small language model both more capable and dramatically cheaper at once, without changing any weights. Verified knowledge is deposited once as a byte-exact key-value (KV) state artifact and later restored, by graft, into a fresh inference context. The restore is bit-exact: under a pinned deterministic configuration, the grafted logits are byte-for-byte identical to a fresh computation (SHA-256 equality), with zero KL divergence and 100% argmax agreement over fifty samples. We show that own-position graft is the unique numerically exact operating point on a model with floating-point rotary encoding, and we verify byte-exactness on two model scales (12B, 31B) and two GPU targets, one through a pre-registered replay. On AIME 2025, a frozen Gemma-4-12B moves from 80.0% to 93.3% once a verified solution library is grafted, above its own 77.5% and its 31B sibling's 89.2% published anchors. On the recurring case, eight problems the base model never solves within a 401,026-token budget are answered from cached verified solutions in 61 total decode tokens, a factor of 6,574 fewer tokens and about 8,700x less energy; the capability claim proper rests on held-out transfer (7 of 7 at 31B). The same byte-exact store widens usable context from 32,768 to 2,854,766 tokens at zero extra accelerator memory, and moves byte-identical between machines of the same architecture. We describe the system at the behavior level; the engine is proprietary, and every reported number is backed by committed input and output hashes so the scoring can be re-checked without it.