ChatPaper.aiChatPaper

KVpop -- Compresión de Caché Clave-Valor con Poda Predictiva en Línea

KVpop -- Key-Value Cache Compression with Predictive Online Pruning

July 6, 2026
Autores: Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl, David Stap, Thomas Schmied, Sebastian Böck, Günter Klambauer, Sepp Hochreiter
cs.AI

Resumen

El crecimiento del caché de clave-valor (KV) es un cuello de botella importante en la decodificación autorregresiva, ya que la memoria y el ancho de banda escalan linealmente con la longitud del contexto. Los métodos existentes de desalojo de KV a menudo se basan en heurísticas estáticas o puntuaciones proxy, que predicen mal la utilidad futura de los tokens y provocan desalojos frágiles a medida que cambia la relevancia. Para abordar esto, presentamos KVpop, que aprende una política de desalojo de KV con presupuesto fijo supervisando directamente la decisión de conservar o descartar. El puntuador se entrena con un novedoso objetivo de atención futura, calculado de manera eficiente sin materializar mapas de atención densos. Además, introducimos un puntuador basado en memoria diferida que, de manera única entre los métodos de desalojo aprendidos, retrasa la puntuación durante un número fijo de pasos para explotar el contexto cercano futuro. En el razonamiento matemático de AIME y HMMT, KVpop retiene el 98% del rendimiento de atención completa en Qwen3-4B con una compresión del caché KV del 75% y el 97% con una compresión del 88%, superando consistentemente a las líneas base de desalojo establecidas. Qwen3-8B muestra resultados aún más sólidos, alcanzando un rendimiento casi del maestro completo. Estos resultados demuestran que supervisar el desalojo con señales de atención futura reduce los costos de memoria manteniendo la calidad.
English
Key-value (KV) cache growth is a major bottleneck in autoregressive decoding, as memory and bandwidth scale linearly with context length. Existing KV eviction methods often rely on static heuristics or proxy scores, which poorly track future token utility and cause brittle eviction as relevance shifts. To address this, we introduce KVpop, which learns a fixed-budget KV eviction policy by directly supervising the keep-or-drop decision. The scorer is trained against a novel future-attention target, computed efficiently without materializing dense attention maps. We further introduce a delayed memory-based scorer that, uniquely among learned eviction methods, defers scoring for a fixed number of steps to exploit near-future context. On AIME and HMMT mathematical reasoning, KVpop retains 98% of full-attention performance on Qwen3-4B at 75% KV cache compression and 97% at 88% compression, consistently outperforming established eviction baselines. Qwen3-8B shows even stronger results, reaching near-full teacher performance. These results show that supervising eviction with future-attention signals cuts memory costs while maintaining quality.