ChatPaper.aiChatPaper

Когда классические политики кэширования оказываются неэффективными: обучение-аугментированная замена для буферов семантического поиска

When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers

July 1, 2026
Авторы: Yushi Sun, Bowen Cao, Wai Lam
cs.AI

Аннотация

Агенты на основе LLM всё чаще полагаются на буферы извлечения для хранения и повторного использования прошлого опыта, однако политики управления кэшем, регулирующие эти буферы, остаются в значительной степени нестандартными. Мы формализуем эту проблему как задачу онлайн-замены семантического кэша с затратами на переключение, где элементы сопоставляются по эмбеддинговому сходству, а качество попадания является непрерывным, а не бинарным. В ходе экспериментов на двух наборах данных из MemoryBench-Full (LoCoMo, DialSim) с использованием 8 политик замены мы обнаруживаем неожиданный вывод: классические эвристики (LRU, LFU) постоянно уступают наивному базовому FIFO на семантических нагрузках из-за отсутствия временной локальности и концентрации частоты. Мы предлагаем SOLAR — обучаемую дополненную структуру, которая выводит время модификации из накопления сожалений (достигая уровня модификации около 17%) и выбор контента на основе байесовского онлайн-обучения по неявной обратной связи при извлечении. Мы доказываем, что SOLAR достигает постоянного коэффициента конкурентоспособности ≤3, независимо от размера кэша и горизонта (по сравнению с Ω(K) для FIFO), и сожаления при вытеснении O(KT log T), что совпадает с нижней границей Ω(KT) с точностью до логарифмических множителей. Эксперименты демонстрируют относительное улучшение на 5–75% по сравнению с FIFO при малых размерах кэша, с четко охарактеризованным фазовым переходом на границе рабочего набора. Синтетические эксперименты с пулами из 5000 элементов дополнительно выявляют перевернутую U-образную зависимость между размером пула и качеством извлечения, что обосновывает ограничения по емкости как явление шума при извлечении, а не как ограничение хранения.
English
LLM agents increasingly rely on retrieval buffers to store and reuse past experience, yet the cache management policies governing these buffers remain largely ad-hoc. We formalize this as an online semantic cache replacement problem with switching costs, where items are matched by embedding similarity and hit quality is continuous rather than binary. Through experiments on two datasets from MemoryBench-Full (LoCoMo, DialSim) with 8 replacement policies, we reveal a surprising finding: classic heuristics (LRU, LFU) consistently underperform the naive FIFO baseline on semantic workloads, due to the absence of temporal locality and frequency concentration. We propose SOLAR, a learning-augmented framework that derives modification timing from regret accumulation (achieving sim17\% modification rate) and content selection from Bayesian online learning over implicit retrieval feedback. We prove SOLAR achieves a constant competitive ratio leq 3, independent of cache size and horizon (vs.\ Ω(K) for FIFO), and eviction regret O(KTlog T), matching the Ω(KT) lower bound up to logarithmic factors. Experiments demonstrate 5--75\% relative improvement over FIFO at tight cache sizes, with a clearly characterized phase transition at the working set boundary. Synthetic experiments with 5000-item pools further reveal an inverted-U relationship between pool size and retrieval quality, justifying capacity constraints as a retrieval noise phenomenon rather than a storage limitation.