SeKV : Cache KV adaptatif à la résolution avec mémoire sémantique hiérarchique pour l'inférence de LLM à long contexte
SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference
June 30, 2026
Auteurs: Amirhossein Abaskohi, Giuseppe Carenini, Peter West, Yuhang He
cs.AI
Résumé
Les grands modèles de langage fonctionnent de plus en plus sur de longs contextes, où le cache KV devient un goulet d'étranglement mémoire dominant : sa taille croît linéairement avec la longueur de la séquence et doit être conservé tout au long du décodage, rendant la mise en cache complète sur GPU prohibitivement coûteuse sans compression. Les méthodes existantes de compression du cache KV peinent à équilibrer efficacité et préservation fidèle du contexte. L'éviction de tokens supprime des informations, tandis que le regroupement sémantique fixe les décisions de compression au moment du préremplissage ; aucune ne peut récupérer les détails au niveau du token à partir d'un segment compressé une fois qu'il devient pertinent lors de la génération.
En solution, nous proposons SeKV, un cache KV sémantique adaptatif en résolution qui organise le contexte en segments sémantiques guidés par l'entropie et les stocke dans une hiérarchie mémoire GPU-CPU sans supprimer d'informations. Chaque segment conserve un vecteur récapitulatif léger sur le GPU pour un routage grossier et une base SVD de bas rang sur le CPU pour une reconstruction au niveau du token à la demande. Un mécanisme de zoom entraîné élargit sélectivement les segments pertinents pour la requête lors du décodage, permettant une récupération précise sans matérialiser l'intégralité du cache KV sur le GPU. SeKV permet une reconstruction adaptative au niveau du token tout en maintenant le LLM de base complètement gelé et en ajoutant moins de 0,05 % de paramètres entraînables.
Sur quatre benchmarks, SeKV améliore la baseline de compression sémantique la plus forte de 5,9 % en moyenne tout en réduisant la mémoire GPU de 53,3 % par rapport à la mise en cache KV complète pour un contexte de 128K. Le code est disponible sur https://github.com/AmirAbaskohi/SeKV.
English
Large language models increasingly operate over long contexts, where the KV cache becomes a dominant memory bottleneck: its size grows linearly with sequence length and must be retained throughout decoding, making full GPU caching prohibitively expensive without compression. Existing KV cache compression methods struggle to balance efficiency with faithful context preservation. Token eviction discards information, while semantic grouping fixes compression decisions at prefill time; neither can recover token-level detail from a compressed span once it becomes relevant during generation. As a solution, we propose SeKV, a resolution-adaptive semantic KV cache that organizes context into entropy-guided semantic spans and stores them across a GPU-CPU memory hierarchy without discarding information. Each span keeps a lightweight summary vector on GPU for coarse routing and a low-rank SVD basis on CPU for on-demand token-level reconstruction. A trained zoom-in mechanism selectively expands query-relevant spans during decoding, enabling precise retrieval without materializing the full KV cache on GPU. SeKV enables adaptive token-level reconstruction while keeping the base LLM fully frozen and adding fewer than 0.05% trainable parameters. Across four benchmarks, SeKV improves over the strongest semantic compression baseline by 5.9% on average while reducing GPU memory by 53.3% versus full KV caching at 128K context. Code is available on https://github.com/AmirAbaskohi/SeKV.