Умнее и дешевле одновременно: побайтно-точная прививка KV-кэша превращает замороженную маленькую модель в маховик верифицированного знания
Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
July 15, 2026
Авторы: Sietse Schelpe
cs.AI
Аннотация
Мы сообщаем о способе одновременного повышения производительности и радикального снижения стоимости замороженной небольшой языковой модели без изменения каких-либо весов. Верифицированное знание однократно сохраняется в виде побайтно точного артефакта состояния «ключ-значение» (KV), а затем восстанавливается путем прививки в новый контекст инференса. Восстановление является побитно точным: при фиксированной детерминированной конфигурации привитые логиты побайтно идентичны новым вычислениям (равенство SHA-256) с нулевой расходимостью KL и 100% совпадением по argmax на пятидесяти выборках. Мы показываем, что прививка на собственную позицию является единственной численно точной рабочей точкой для модели с роторным кодированием с плавающей точкой, и мы проверяем побайтную точность на двух масштабах модели (12B, 31B) и двух целевых GPU, причем один из них — через предварительно зарегистрированный повтор. На AIME 2025 замороженная Gemma-4-12B переходит с 80.0% на 93.3% после прививки библиотеки верифицированных решений, что превышает ее собственный опубликованный ориентир 77.5% и ориентир ее 31B-аналога 89.2%. В повторяющемся случае восемь задач, которые базовая модель никогда не решает в рамках бюджета в 401 026 токенов, решаются из кэшированных верифицированных решений всего за 61 токен декодирования, что в 6 574 раза меньше токенов и примерно в 8 700 раз меньше энергии; собственно заявление о возможностях основывается на переносе на отложенных данных (7 из 7 на 31B). То же побайтно точное хранилище расширяет используемый контекст с 32 768 до 2 854 766 токенов без дополнительной памяти ускорителя и переносится побайтно идентично между машинами одной архитектуры. Мы описываем систему на уровне поведения; движок является проприетарным, и каждое приведенное число подкреплено зафиксированными хешами входных и выходных данных, чтобы оценку можно было перепроверить без него.
English
We report a way to make a frozen small language model both more capable and dramatically cheaper at once, without changing any weights. Verified knowledge is deposited once as a byte-exact key-value (KV) state artifact and later restored, by graft, into a fresh inference context. The restore is bit-exact: under a pinned deterministic configuration, the grafted logits are byte-for-byte identical to a fresh computation (SHA-256 equality), with zero KL divergence and 100% argmax agreement over fifty samples. We show that own-position graft is the unique numerically exact operating point on a model with floating-point rotary encoding, and we verify byte-exactness on two model scales (12B, 31B) and two GPU targets, one through a pre-registered replay. On AIME 2025, a frozen Gemma-4-12B moves from 80.0% to 93.3% once a verified solution library is grafted, above its own 77.5% and its 31B sibling's 89.2% published anchors. On the recurring case, eight problems the base model never solves within a 401,026-token budget are answered from cached verified solutions in 61 total decode tokens, a factor of 6,574 fewer tokens and about 8,700x less energy; the capability claim proper rests on held-out transfer (7 of 7 at 31B). The same byte-exact store widens usable context from 32,768 to 2,854,766 tokens at zero extra accelerator memory, and moves byte-identical between machines of the same architecture. We describe the system at the behavior level; the engine is proprietary, and every reported number is backed by committed input and output hashes so the scoring can be re-checked without it.