Slimmer en goedkoper tegelijk: Byte-exacte KV-cache-transplantatie verandert een bevroren klein model in een vliegwiel van geverifieerde kennis.
Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
July 15, 2026
Auteurs: Sietse Schelpe
cs.AI
Samenvatting
Wij rapporteren een manier om een bevroren klein taalmodel tegelijkertijd capabeler en dramatisch goedkoper te maken, zonder enige gewichten te veranderen. Geverifieerde kennis wordt eenmalig gedeponeerd als een byte-exact key-value (KV) toestandsartefact en later hersteld, door enting, in een nieuwe inferentiecontext. Het herstel is bit-exact: onder een vastgezette deterministische configuratie zijn de geënte logits byte-voor-byte identiek aan een nieuwe berekening (SHA-256 gelijkheid), met nul KL-divergentie en 100% argmax-overeenstemming over vijftig samples. Wij tonen aan dat eigen-positie-enting het unieke numeriek exacte werkpunt is op een model met drijvende-komma rotatiecodering, en wij verifiëren byte-exactheid op twee modelschalen (12B, 31B) en twee GPU-doelen, waarvan één via een vooraf geregistreerde replay. Op AIME 2025 stijgt een bevroren Gemma-4-12B van 80,0% naar 93,3% zodra een geverifieerde oplossingsbibliotheek wordt geënt, boven zijn eigen 77,5% en de gepubliceerde ankers van zijn 31B-tegenhanger van 89,2%. In het terugkerende geval worden acht problemen die het basismodel nooit oplost binnen een budget van 401.026 tokens beantwoord vanuit gecachte geverifieerde oplossingen in 61 totale decodeertokens, een factor van 6.574 minder tokens en ongeveer 8.700× minder energie; de eigenlijke capaciteitsclaim berust op out-of-sample transfer (7 van de 7 bij 31B). Dezelfde byte-exacte opslag verbreedt de bruikbare context van 32.768 naar 2.854.766 tokens zonder extra acceleratorgeheugen, en verplaatst byte-identiek tussen machines van dezelfde architectuur. Wij beschrijven het systeem op gedragsniveau; de engine is propriëtair, en elk gerapporteerd getal wordt ondersteund door vastgelegde input- en output-hashes zodat de score kan worden nagecontroleerd zonder de engine.
English
We report a way to make a frozen small language model both more capable and dramatically cheaper at once, without changing any weights. Verified knowledge is deposited once as a byte-exact key-value (KV) state artifact and later restored, by graft, into a fresh inference context. The restore is bit-exact: under a pinned deterministic configuration, the grafted logits are byte-for-byte identical to a fresh computation (SHA-256 equality), with zero KL divergence and 100% argmax agreement over fifty samples. We show that own-position graft is the unique numerically exact operating point on a model with floating-point rotary encoding, and we verify byte-exactness on two model scales (12B, 31B) and two GPU targets, one through a pre-registered replay. On AIME 2025, a frozen Gemma-4-12B moves from 80.0% to 93.3% once a verified solution library is grafted, above its own 77.5% and its 31B sibling's 89.2% published anchors. On the recurring case, eight problems the base model never solves within a 401,026-token budget are answered from cached verified solutions in 61 total decode tokens, a factor of 6,574 fewer tokens and about 8,700x less energy; the capability claim proper rests on held-out transfer (7 of 7 at 31B). The same byte-exact store widens usable context from 32,768 to 2,854,766 tokens at zero extra accelerator memory, and moves byte-identical between machines of the same architecture. We describe the system at the behavior level; the engine is proprietary, and every reported number is backed by committed input and output hashes so the scoring can be re-checked without it.