ChatPaper.aiChatPaper

KVpop -- Sleutel-Waarde Cache Compressie met Predictief Online Snoeien

KVpop -- Key-Value Cache Compression with Predictive Online Pruning

July 6, 2026
Auteurs: Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl, David Stap, Thomas Schmied, Sebastian Böck, Günter Klambauer, Sepp Hochreiter
cs.AI

Samenvatting

De groei van de key-value (KV) cache is een grote bottleneck in autoregressieve decodering, omdat geheugen en bandbreedte lineair schalen met de contextlengte. Bestaande methoden voor KV-verwijdering vertrouwen vaak op statische heuristieken of proxy-scores, die het nut van toekomstige tokens slecht bijhouden en leiden tot breekbare verwijdering wanneer de relevantie verschuift. Om dit aan te pakken introduceren we KVpop, dat een KV-verwijderingsbeleid met een vast budget leert door direct toezicht te houden op de bewaar-of-verwijder beslissing. De scorer wordt getraind met een nieuw toekomstgericht aandachtsdoelwit, dat efficiënt wordt berekend zonder dichte aandachtskaarten te materialiseren. We introduceren verder een vertraagde geheugen-gebaseerde scorer die, uniek onder geleerde verwijderingsmethoden, het scoren uitstelt voor een vast aantal stappen om gebruik te maken van de nabije toekomstige context. Op AIME en HMMT wiskundig redeneren behoudt KVpop 98% van de volledige-aandachtsprestatie op Qwen3-4B bij 75% KV-cachecompressie en 97% bij 88% compressie, en presteert consequent beter dan gevestigde verwijderingsbaselines. Qwen3-8B toont nog sterkere resultaten en bereikt bijna volledige lerarenprestatie. Deze resultaten tonen aan dat het toezicht houden op verwijdering met toekomstige-aandachtssignalen de geheugenkosten verlaagt terwijl de kwaliteit behouden blijft.
English
Key-value (KV) cache growth is a major bottleneck in autoregressive decoding, as memory and bandwidth scale linearly with context length. Existing KV eviction methods often rely on static heuristics or proxy scores, which poorly track future token utility and cause brittle eviction as relevance shifts. To address this, we introduce KVpop, which learns a fixed-budget KV eviction policy by directly supervising the keep-or-drop decision. The scorer is trained against a novel future-attention target, computed efficiently without materializing dense attention maps. We further introduce a delayed memory-based scorer that, uniquely among learned eviction methods, defers scoring for a fixed number of steps to exploit near-future context. On AIME and HMMT mathematical reasoning, KVpop retains 98% of full-attention performance on Qwen3-4B at 75% KV cache compression and 97% at 88% compression, consistently outperforming established eviction baselines. Qwen3-8B shows even stronger results, reaching near-full teacher performance. These results show that supervising eviction with future-attention signals cuts memory costs while maintaining quality.