ChatPaper.aiChatPaper

KVpop -- Compression du cache clé-valeur avec élagage prédictif en ligne

KVpop -- Key-Value Cache Compression with Predictive Online Pruning

July 6, 2026
Auteurs: Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl, David Stap, Thomas Schmied, Sebastian Böck, Günter Klambauer, Sepp Hochreiter
cs.AI

Résumé

La croissance du cache de paires clé-valeur (KV) constitue un goulet d'étranglement majeur dans le décodage autorégressif, car la mémoire et la bande passante augmentent linéairement avec la longueur du contexte. Les méthodes existantes d'éviction du cache KV reposent souvent sur des heuristiques statiques ou des scores proxy, qui suivent mal l'utilité future des tokens et provoquent une éviction fragile lorsque la pertinence évolue. Pour y remédier, nous introduisons KVpop, qui apprend une politique d'éviction du cache KV à budget fixe en supervisant directement la décision de conservation ou de suppression. Le scoreur est entraîné vis-à-vis d'une nouvelle cible d'attention future, calculée efficacement sans matérialiser de cartes d'attention denses. Nous introduisons en outre un scoreur à mémoire différée qui, de manière unique parmi les méthodes d'éviction apprises, retarde le score d'un nombre fixe d'étapes afin d'exploiter le contexte proche futur. Sur les tâches de raisonnement mathématique AIME et HMMT, KVpop conserve 98 % de la performance de l'attention complète sur Qwen3‑4B avec une compression du cache KV à 75 %, et 97 % avec une compression à 88 %, surpassant systématiquement les références de base établies en matière d'éviction. Qwen3‑8B montre des résultats encore plus solides, atteignant une performance quasi‑identique à celle du modèle enseignant complet. Ces résultats montrent que la supervision de l'éviction par des signaux d'attention future réduit les coûts mémoire tout en maintenant la qualité.
English
Key-value (KV) cache growth is a major bottleneck in autoregressive decoding, as memory and bandwidth scale linearly with context length. Existing KV eviction methods often rely on static heuristics or proxy scores, which poorly track future token utility and cause brittle eviction as relevance shifts. To address this, we introduce KVpop, which learns a fixed-budget KV eviction policy by directly supervising the keep-or-drop decision. The scorer is trained against a novel future-attention target, computed efficiently without materializing dense attention maps. We further introduce a delayed memory-based scorer that, uniquely among learned eviction methods, defers scoring for a fixed number of steps to exploit near-future context. On AIME and HMMT mathematical reasoning, KVpop retains 98% of full-attention performance on Qwen3-4B at 75% KV cache compression and 97% at 88% compression, consistently outperforming established eviction baselines. Qwen3-8B shows even stronger results, reaching near-full teacher performance. These results show that supervising eviction with future-attention signals cuts memory costs while maintaining quality.