SeKV: адаптивный по разрешению KV-кэш с иерархической семантической памятью для вывода LLM с длинным контекстом
SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference
June 30, 2026
Авторы: Amirhossein Abaskohi, Giuseppe Carenini, Peter West, Yuhang He
cs.AI
Аннотация
Большие языковые модели всё чаще работают с длинными контекстами, где KV-кэш становится основным узким местом по памяти: его размер растёт линейно с длиной последовательности и должен сохраняться на протяжении всего декодирования, что делает полное кэширование на GPU непомерно дорогим без сжатия. Существующие методы сжатия KV-кэша с трудом балансируют между эффективностью и точным сохранением контекста. Удаление токенов отбрасывает информацию, а семантическая группировка фиксирует решения о сжатии на этапе предзаполнения; ни то, ни другое не может восстановить детали на уровне токенов из сжатого отрезка, когда он становится актуальным во время генерации. В качестве решения мы предлагаем SeKV — семантический KV-кэш с адаптивным разрешением, который организует контекст в семантические отрезки, управляемые энтропией, и хранит их в иерархии памяти GPU-CPU без отбрасывания информации. Каждый отрезок хранит лёгкий вектор сводки на GPU для грубой маршрутизации и низкоранговый SVD-базис на CPU для восстановления на уровне токенов по запросу. Обученный механизм приближения выборочно расширяет отрезки, релевантные запросу, во время декодирования, обеспечивая точное извлечение без материализации полного KV-кэша на GPU. SeKV обеспечивает адаптивное восстановление на уровне токенов, сохраняя базовую LLM полностью замороженной и добавляя менее 0,05% обучаемых параметров. На четырёх бенчмарках SeKV превосходит сильнейший базовый метод семантического сжатия в среднем на 5,9%, одновременно снижая использование памяти GPU на 53,3% по сравнению с полным KV-кэшированием при контексте в 128K. Код доступен по адресу https://github.com/AmirAbaskohi/SeKV.
English
Large language models increasingly operate over long contexts, where the KV cache becomes a dominant memory bottleneck: its size grows linearly with sequence length and must be retained throughout decoding, making full GPU caching prohibitively expensive without compression. Existing KV cache compression methods struggle to balance efficiency with faithful context preservation. Token eviction discards information, while semantic grouping fixes compression decisions at prefill time; neither can recover token-level detail from a compressed span once it becomes relevant during generation. As a solution, we propose SeKV, a resolution-adaptive semantic KV cache that organizes context into entropy-guided semantic spans and stores them across a GPU-CPU memory hierarchy without discarding information. Each span keeps a lightweight summary vector on GPU for coarse routing and a low-rank SVD basis on CPU for on-demand token-level reconstruction. A trained zoom-in mechanism selectively expands query-relevant spans during decoding, enabling precise retrieval without materializing the full KV cache on GPU. SeKV enables adaptive token-level reconstruction while keeping the base LLM fully frozen and adding fewer than 0.05% trainable parameters. Across four benchmarks, SeKV improves over the strongest semantic compression baseline by 5.9% on average while reducing GPU memory by 53.3% versus full KV caching at 128K context. Code is available on https://github.com/AmirAbaskohi/SeKV.