Más inteligente y más barato a la vez: injerto de caché KV exacto en bytes convierte un pequeño modelo congelado en un volante de conocimiento verificado
Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
July 15, 2026
Autores: Sietse Schelpe
cs.AI
Resumen
Presentamos un método para hacer que un modelo de lenguaje pequeño y congelado sea a la vez más capaz y drásticamente más barato, sin modificar ningún peso. El conocimiento verificado se deposita una vez como un artefacto de estado clave-valor (KV) exacto en bytes y luego se restaura, mediante injerto, en un nuevo contexto de inferencia. La restauración es exacta en bits: bajo una configuración determinista fija, los logits injertados son idénticos byte por byte a un cálculo nuevo (igualdad SHA-256), con divergencia KL cero y concordancia del 100% en argmax sobre cincuenta muestras. Demostramos que el injerto en la misma posición es el único punto de operación numéricamente exacto en un modelo con codificación rotatoria de punto flotante, y verificamos la exactitud en bytes en dos escalas de modelo (12B, 31B) y dos objetivos de GPU, uno mediante una reproducción preregistrada. En AIME 2025, un Gemma-4-12B congelado pasa de 80.0% a 93.3% una vez que se injerta una biblioteca de soluciones verificadas, superando sus propios puntos de referencia publicados del 77.5% y los de su hermano de 31B del 89.2%. En el caso recurrente, ocho problemas que el modelo base nunca resuelve dentro de un presupuesto de 401 026 tokens se responden a partir de soluciones verificadas almacenadas en caché en solo 61 tokens de decodificación total, un factor de 6574 tokens menos y aproximadamente 8700 veces menos energía; la afirmación de capacidad propiamente dicha se apoya en la transferencia reservada (7 de 7 en 31B). El mismo almacén exacto en bytes amplía el contexto utilizable de 32 768 a 2 854 766 tokens sin memoria adicional del acelerador, y se traslada idéntico en bytes entre máquinas de la misma arquitectura. Describimos el sistema a nivel de comportamiento; el motor es propietario, y cada número reportado está respaldado por hashes de entrada y salida confirmados, de modo que la puntuación pueda volverse a verificar sin él.
English
We report a way to make a frozen small language model both more capable and dramatically cheaper at once, without changing any weights. Verified knowledge is deposited once as a byte-exact key-value (KV) state artifact and later restored, by graft, into a fresh inference context. The restore is bit-exact: under a pinned deterministic configuration, the grafted logits are byte-for-byte identical to a fresh computation (SHA-256 equality), with zero KL divergence and 100% argmax agreement over fifty samples. We show that own-position graft is the unique numerically exact operating point on a model with floating-point rotary encoding, and we verify byte-exactness on two model scales (12B, 31B) and two GPU targets, one through a pre-registered replay. On AIME 2025, a frozen Gemma-4-12B moves from 80.0% to 93.3% once a verified solution library is grafted, above its own 77.5% and its 31B sibling's 89.2% published anchors. On the recurring case, eight problems the base model never solves within a 401,026-token budget are answered from cached verified solutions in 61 total decode tokens, a factor of 6,574 fewer tokens and about 8,700x less energy; the capability claim proper rests on held-out transfer (7 of 7 at 31B). The same byte-exact store widens usable context from 32,768 to 2,854,766 tokens at zero extra accelerator memory, and moves byte-identical between machines of the same architecture. We describe the system at the behavior level; the engine is proprietary, and every reported number is backed by committed input and output hashes so the scoring can be re-checked without it.