Wanneer klassieke cachestrategieën falen: leerverbeterde vervanging voor semantische retrievalbuffers
When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers
July 1, 2026
Auteurs: Yushi Sun, Bowen Cao, Wai Lam
cs.AI
Samenvatting
LLM-agenten vertrouwen steeds vaker op retrievalbuffers om eerdere ervaringen op te slaan en te hergebruiken, maar het cachebeheerbeleid dat deze buffers regelt, blijft grotendeels ad-hoc. We formaliseren dit als een online semantisch cachevervangingsprobleem met wisselkosten, waarbij items worden vergeleken op basis van embeddingsimilariteit en de raakkwaliteit continu is in plaats van binair. Via experimenten op twee datasets uit MemoryBench-Full (LoCoMo, DialSim) met 8 vervangingsbeleidsregels onthullen we een verrassende bevinding: klassieke heuristieken (LRU, LFU) presteren consequent slechter dan de naïeve FIFO-baseline op semantische workloads, vanwege het ontbreken van temporele localiteit en frequentieconcentratie. We stellen SOLAR voor, een leerversterkt raamwerk dat aanpassingstijdstippen afleidt uit spijtaccumulatie (wat leidt tot een modificatiepercentage van sim17%) en inhoudsselectie uit Bayesiaans online leren over impliciete retrievalfeedback. We bewijzen dat SOLAR een constante concurrentieverhouding ≤ 3 bereikt, onafhankelijk van cachegrootte en horizon (tegenover Ω(K) voor FIFO), en een uitzettingsspijt van O(KT log T), wat de ondergrens van Ω(KT) tot op logaritmische factoren benadert. Experimenten tonen een relatieve verbetering van 5–75% ten opzichte van FIFO bij krappe cachegroottes, met een duidelijk gekarakteriseerde faseovergang aan de werkverzamelinggrens. Synthetische experimenten met pools van 5000 items onthullen verder een omgekeerde U-relatie tussen poolgrootte en retrievalkwaliteit, wat capaciteitsbeperkingen rechtvaardigt als een fenomeen van retrievalruis in plaats van een opslagbeperking.
English
LLM agents increasingly rely on retrieval buffers to store and reuse past experience, yet the cache management policies governing these buffers remain largely ad-hoc. We formalize this as an online semantic cache replacement problem with switching costs, where items are matched by embedding similarity and hit quality is continuous rather than binary. Through experiments on two datasets from MemoryBench-Full (LoCoMo, DialSim) with 8 replacement policies, we reveal a surprising finding: classic heuristics (LRU, LFU) consistently underperform the naive FIFO baseline on semantic workloads, due to the absence of temporal locality and frequency concentration. We propose SOLAR, a learning-augmented framework that derives modification timing from regret accumulation (achieving sim17\% modification rate) and content selection from Bayesian online learning over implicit retrieval feedback. We prove SOLAR achieves a constant competitive ratio leq 3, independent of cache size and horizon (vs.\ Ω(K) for FIFO), and eviction regret O(KTlog T), matching the Ω(KT) lower bound up to logarithmic factors. Experiments demonstrate 5--75\% relative improvement over FIFO at tight cache sizes, with a clearly characterized phase transition at the working set boundary. Synthetic experiments with 5000-item pools further reveal an inverted-U relationship between pool size and retrieval quality, justifying capacity constraints as a retrieval noise phenomenon rather than a storage limitation.