SeKV: Cache KV Adaptável à Resolução com Memória Semântica Hierárquica para Inferência de LLM de Contexto Longo
SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference
June 30, 2026
Autores: Amirhossein Abaskohi, Giuseppe Carenini, Peter West, Yuhang He
cs.AI
Resumo
Modelos de linguagem de grande porte operam cada vez mais em contextos longos, onde o cache de KV se torna um gargalo de memória dominante: seu tamanho cresce linearmente com o comprimento da sequência e deve ser mantido durante toda a decodificação, tornando o cache completo em GPU proibitivamente caro sem compressão. Os métodos existentes de compressão do cache de KV têm dificuldade em equilibrar eficiência com preservação fiel do contexto. A remoção de tokens descarta informações, enquanto o agrupamento semântico fixa as decisões de compressão no momento de preenchimento; nenhum deles consegue recuperar detalhes no nível de tokens a partir de um intervalo comprimido quando este se torna relevante durante a geração. Como solução, propomos o SeKV, um cache semântico de KV com resolução adaptável que organiza o contexto em intervalos semânticos guiados por entropia e os armazena em uma hierarquia de memória GPU-CPU sem descartar informações. Cada intervalo mantém um vetor de resumo leve na GPU para roteamento grosseiro e uma base SVD de baixo posto na CPU para reconstrução no nível de tokens sob demanda. Um mecanismo de aproximação treinado expande seletivamente intervalos relevantes para a consulta durante a decodificação, permitindo recuperação precisa sem materializar o cache de KV completo na GPU. O SeKV possibilita reconstrução adaptativa no nível de tokens, mantendo o LLM base completamente congelado e adicionando menos de 0,05% de parâmetros treináveis. Em quatro benchmarks, o SeKV supera a linha de base mais forte de compressão semântica em 5,9% em média, enquanto reduz a memória da GPU em 53,3% em comparação com o cache de KV completo em contexto de 128K. O código está disponível em https://github.com/AmirAbaskohi/SeKV.
English
Large language models increasingly operate over long contexts, where the KV cache becomes a dominant memory bottleneck: its size grows linearly with sequence length and must be retained throughout decoding, making full GPU caching prohibitively expensive without compression. Existing KV cache compression methods struggle to balance efficiency with faithful context preservation. Token eviction discards information, while semantic grouping fixes compression decisions at prefill time; neither can recover token-level detail from a compressed span once it becomes relevant during generation. As a solution, we propose SeKV, a resolution-adaptive semantic KV cache that organizes context into entropy-guided semantic spans and stores them across a GPU-CPU memory hierarchy without discarding information. Each span keeps a lightweight summary vector on GPU for coarse routing and a low-rank SVD basis on CPU for on-demand token-level reconstruction. A trained zoom-in mechanism selectively expands query-relevant spans during decoding, enabling precise retrieval without materializing the full KV cache on GPU. SeKV enables adaptive token-level reconstruction while keeping the base LLM fully frozen and adding fewer than 0.05% trainable parameters. Across four benchmarks, SeKV improves over the strongest semantic compression baseline by 5.9% on average while reducing GPU memory by 53.3% versus full KV caching at 128K context. Code is available on https://github.com/AmirAbaskohi/SeKV.