Schlauer und günstiger zugleich: Byte-genaue KV-Cache-Transplantation verwandelt ein eingefrorenes kleines Modell in ein Schwungrad für verifiziertes Wissen
Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
July 15, 2026
Autoren: Sietse Schelpe
cs.AI
Zusammenfassung
Wir berichten über eine Methode, mit der ein eingefrorenes kleines Sprachmodell gleichzeitig leistungsfähiger und dramatisch kostengünstiger gemacht werden kann, ohne dass Gewichte verändert werden müssen. Verifiziertes Wissen wird einmalig als bytegenaues Key-Value (KV)-Zustandsartefakt abgelegt und später durch Pfropfung in einen neuen Inferenzkontext wiederhergestellt. Die Wiederherstellung ist bitexakt: Unter einer festgelegten deterministischen Konfiguration sind die eingepfropften Logits byteweise identisch mit einer Neuberechnung (SHA-256-Gleichheit), mit einer KL-Divergenz von null und 100%iger Argmax-Übereinstimmung über fünfzig Stichproben. Wir zeigen, dass die Pfropfung auf die eigene Position der einzige numerisch exakte Arbeitspunkt bei einem Modell mit Gleitkomma-Rotary-Codierung ist, und verifizieren die Bytegenauigkeit auf zwei Modellskalen (12B, 31B) sowie zwei GPU-Zielen, wobei eines über eine vorregistrierte Wiedergabe erfolgt. Bei AIME 2025 steigt ein eingefrorenes Gemma-4-12B von 80,0 % auf 93,3 %, sobald eine verifizierte Lösungsbibliothek eingepfropft wird, und liegt damit über seinen eigenen veröffentlichten Ankern von 77,5 % und den 89,2 % seines 31B-Pendants. Im wiederkehrenden Fall werden acht Aufgaben, die das Basismodell innerhalb eines Budgets von 401.026 Token nie löst, aus zwischengespeicherten verifizierten Lösungen mit insgesamt 61 Decode-Token beantwortet – ein Faktor von 6.574 weniger Token und etwa 8.700-fach weniger Energie; der eigentliche Leistungsanspruch stützt sich auf zurückgehaltene Übertragungen (7 von 7 bei 31B). Derselbe bytegenaue Speicher erweitert den nutzbaren Kontext von 32.768 auf 2.854.766 Token bei null zusätzlichem Beschleunigerspeicher und überträgt sich byteidentisch zwischen Maschinen derselben Architektur. Wir beschreiben das System auf Verhaltensebene; die Engine ist proprietär, und jede berichtete Zahl wird durch festgelegte Eingabe- und Ausgabe-Hashes abgesichert, sodass die Bewertung ohne sie überprüft werden kann.
English
We report a way to make a frozen small language model both more capable and dramatically cheaper at once, without changing any weights. Verified knowledge is deposited once as a byte-exact key-value (KV) state artifact and later restored, by graft, into a fresh inference context. The restore is bit-exact: under a pinned deterministic configuration, the grafted logits are byte-for-byte identical to a fresh computation (SHA-256 equality), with zero KL divergence and 100% argmax agreement over fifty samples. We show that own-position graft is the unique numerically exact operating point on a model with floating-point rotary encoding, and we verify byte-exactness on two model scales (12B, 31B) and two GPU targets, one through a pre-registered replay. On AIME 2025, a frozen Gemma-4-12B moves from 80.0% to 93.3% once a verified solution library is grafted, above its own 77.5% and its 31B sibling's 89.2% published anchors. On the recurring case, eight problems the base model never solves within a 401,026-token budget are answered from cached verified solutions in 61 total decode tokens, a factor of 6,574 fewer tokens and about 8,700x less energy; the capability claim proper rests on held-out transfer (7 of 7 at 31B). The same byte-exact store widens usable context from 32,768 to 2,854,766 tokens at zero extra accelerator memory, and moves byte-identical between machines of the same architecture. We describe the system at the behavior level; the engine is proprietary, and every reported number is backed by committed input and output hashes so the scoring can be re-checked without it.