ChatPaper.aiChatPaper

KVpop -- Compressão de Cache Chave-Valor com Poda Online Preditiva

KVpop -- Key-Value Cache Compression with Predictive Online Pruning

July 6, 2026
Autores: Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl, David Stap, Thomas Schmied, Sebastian Böck, Günter Klambauer, Sepp Hochreiter
cs.AI

Resumo

O crescimento do cache de chave-valor (KV) é um gargalo importante na decodificação autorregressiva, uma vez que a memória e a largura de banda escalam linearmente com o comprimento do contexto. Métodos existentes de remoção de KV frequentemente dependem de heurísticas estáticas ou pontuações proxy, que acompanham mal a utilidade futura dos tokens e causam remoções frágeis à medida que a relevância muda. Para resolver isso, apresentamos o KVpop, que aprende uma política de remoção de KV com orçamento fixo ao supervisionar diretamente a decisão de manter ou descartar. O pontuador é treinado com um novo alvo de atenção futura, computado eficientemente sem materializar mapas de atenção densos. Introduzimos ainda um pontuador baseado em memória atrasada que, de forma única entre os métodos de remoção aprendidos, adia a pontuação por um número fixo de etapas para explorar o contexto de futuro próximo. No raciocínio matemático AIME e HMMT, o KVpop retém 98% do desempenho de atenção total no Qwen3-4B com compressão de 75% do cache KV e 97% com compressão de 88%, superando consistentemente as linhas de base de remoção estabelecidas. O Qwen3-8B apresenta resultados ainda mais fortes, atingindo desempenho quase total do professor. Esses resultados mostram que supervisionar a remoção com sinais de atenção futura reduz os custos de memória enquanto mantém a qualidade.
English
Key-value (KV) cache growth is a major bottleneck in autoregressive decoding, as memory and bandwidth scale linearly with context length. Existing KV eviction methods often rely on static heuristics or proxy scores, which poorly track future token utility and cause brittle eviction as relevance shifts. To address this, we introduce KVpop, which learns a fixed-budget KV eviction policy by directly supervising the keep-or-drop decision. The scorer is trained against a novel future-attention target, computed efficiently without materializing dense attention maps. We further introduce a delayed memory-based scorer that, uniquely among learned eviction methods, defers scoring for a fixed number of steps to exploit near-future context. On AIME and HMMT mathematical reasoning, KVpop retains 98% of full-attention performance on Qwen3-4B at 75% KV cache compression and 97% at 88% compression, consistently outperforming established eviction baselines. Qwen3-8B shows even stronger results, reaching near-full teacher performance. These results show that supervising eviction with future-attention signals cuts memory costs while maintaining quality.