ChatPaper.aiChatPaper

KVpop — сжатие кэша пар ключ-значение с прогностическим онлайн-прореживанием

KVpop -- Key-Value Cache Compression with Predictive Online Pruning

July 6, 2026
Авторы: Lukas Hauzenberger, Niklas Schmidinger, Anamaria-Roberta Hartl, David Stap, Thomas Schmied, Sebastian Böck, Günter Klambauer, Sepp Hochreiter
cs.AI

Аннотация

Рост кэша ключ-значение (KV) является основным узким местом при авторегрессивном декодировании, так как объем памяти и пропускная способность растут линейно с длиной контекста. Существующие методы вытеснения KV часто полагаются на статические эвристики или прокси-оценки, которые плохо предсказывают полезность будущих токенов и приводят к неустойчивому вытеснению при изменении релевантности. Для решения этой проблемы мы представляем KVpop, который обучает политику вытеснения KV с фиксированным бюджетом путем прямой супервизии решения "сохранить или удалить". Оценщик обучается на основе новой целевой функции будущего внимания, вычисляемой эффективно без материализации плотных карт внимания. Мы дополнительно вводим оценщик с отложенной памятью, который, уникально среди методов обучения вытеснению, откладывает оценку на фиксированное число шагов, чтобы использовать контекст ближайшего будущего. На математических задачах AIME и HMMT KVpop сохраняет 98% производительности полного внимания на Qwen3-4B при 75% сжатии KV-кэша и 97% при 88% сжатии, последовательно превосходя установленные базовые методы вытеснения. Qwen3-8B показывает еще более сильные результаты, достигая практически полной производительности учителя. Эти результаты показывают, что супервизия вытеснения с помощью сигналов будущего внимания снижает затраты памяти, сохраняя качество.
English
Key-value (KV) cache growth is a major bottleneck in autoregressive decoding, as memory and bandwidth scale linearly with context length. Existing KV eviction methods often rely on static heuristics or proxy scores, which poorly track future token utility and cause brittle eviction as relevance shifts. To address this, we introduce KVpop, which learns a fixed-budget KV eviction policy by directly supervising the keep-or-drop decision. The scorer is trained against a novel future-attention target, computed efficiently without materializing dense attention maps. We further introduce a delayed memory-based scorer that, uniquely among learned eviction methods, defers scoring for a fixed number of steps to exploit near-future context. On AIME and HMMT mathematical reasoning, KVpop retains 98% of full-attention performance on Qwen3-4B at 75% KV cache compression and 97% at 88% compression, consistently outperforming established eviction baselines. Qwen3-8B shows even stronger results, reaching near-full teacher performance. These results show that supervising eviction with future-attention signals cuts memory costs while maintaining quality.