SeKV: Caché KV Adaptativo en Resolución con Memoria Semántica Jerárquica para Inferencia de LLM de Contexto Largo
SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference
June 30, 2026
Autores: Amirhossein Abaskohi, Giuseppe Carenini, Peter West, Yuhang He
cs.AI
Resumen
Los modelos de lenguaje grandes operan cada vez más sobre contextos extensos, donde la caché KV se convierte en un cuello de botella de memoria dominante: su tamaño crece linealmente con la longitud de la secuencia y debe mantenerse durante toda la decodificación, lo que hace que el almacenamiento completo en GPU sea prohibitivamente costoso sin compresión. Los métodos existentes de compresión de caché KV tienen dificultades para equilibrar la eficiencia con la preservación fiel del contexto. La eliminación de tokens descarta información, mientras que la agrupación semántica fija las decisiones de compresión en el momento de precarga; ninguno puede recuperar información a nivel de token a partir de un segmento comprimido una vez que este se vuelve relevante durante la generación. Como solución, proponemos SeKV, una caché KV semántica adaptable en resolución que organiza el contexto en segmentos semánticos guiados por entropía y los almacena en una jerarquía de memoria GPU-CPU sin descartar información. Cada segmento mantiene un vector de resumen ligero en la GPU para enrutamiento general y una base SVD de bajo rango en la CPU para reconstrucción a nivel de token bajo demanda. Un mecanismo de acercamiento entrenado expande selectivamente los segmentos relevantes para la consulta durante la decodificación, permitiendo una recuperación precisa sin materializar la caché KV completa en la GPU. SeKV habilita una reconstrucción adaptativa a nivel de token mientras mantiene el modelo LLM base completamente congelado y añade menos del 0.05% de parámetros entrenables. En cuatro evaluaciones comparativas, SeKV mejora la línea base de compresión semántica más fuerte en un 5.9% en promedio, a la vez que reduce la memoria GPU en un 53.3% en comparación con el almacenamiento completo de la caché KV para contexto de 128K. El código está disponible en https://github.com/AmirAbaskohi/SeKV.
English
Large language models increasingly operate over long contexts, where the KV cache becomes a dominant memory bottleneck: its size grows linearly with sequence length and must be retained throughout decoding, making full GPU caching prohibitively expensive without compression. Existing KV cache compression methods struggle to balance efficiency with faithful context preservation. Token eviction discards information, while semantic grouping fixes compression decisions at prefill time; neither can recover token-level detail from a compressed span once it becomes relevant during generation. As a solution, we propose SeKV, a resolution-adaptive semantic KV cache that organizes context into entropy-guided semantic spans and stores them across a GPU-CPU memory hierarchy without discarding information. Each span keeps a lightweight summary vector on GPU for coarse routing and a low-rank SVD basis on CPU for on-demand token-level reconstruction. A trained zoom-in mechanism selectively expands query-relevant spans during decoding, enabling precise retrieval without materializing the full KV cache on GPU. SeKV enables adaptive token-level reconstruction while keeping the base LLM fully frozen and adding fewer than 0.05% trainable parameters. Across four benchmarks, SeKV improves over the strongest semantic compression baseline by 5.9% on average while reducing GPU memory by 53.3% versus full KV caching at 128K context. Code is available on https://github.com/AmirAbaskohi/SeKV.