ChatPaper.aiChatPaper

Quand les politiques de cache classiques échouent : remplacement augmenté par l'apprentissage pour les tampons de récupération sémantique

When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers

July 1, 2026
Auteurs: Yushi Sun, Bowen Cao, Wai Lam
cs.AI

Résumé

Les agents LLM s'appuient de plus en plus sur des tampons de récupération pour stocker et réutiliser l'expérience passée, mais les politiques de gestion du cache qui régissent ces tampons restent largement ad hoc. Nous formalisons ce problème comme un problème de remplacement de cache sémantique en ligne avec coûts de commutation, où les éléments sont appariés par similarité d'embedding et la qualité des hits est continue plutôt que binaire. À travers des expériences sur deux ensembles de données de MemoryBench-Full (LoCoMo, DialSim) avec 8 politiques de remplacement, nous révélons une découverte surprenante : les heuristiques classiques (LRU, LFU) performent systématiquement moins bien que la ligne de base naïve FIFO sur les charges de travail sémantiques, en raison de l'absence de localité temporelle et de concentration de fréquence. Nous proposons SOLAR, un cadre augmenté par apprentissage qui dérive le moment de modification à partir de l'accumulation de regrets (atteignant un taux de modification d'environ 17 %) et la sélection de contenu à partir d'un apprentissage bayésien en ligne sur un retour implicite de récupération. Nous prouvons que SOLAR atteint un ratio compétitif constant ≤ 3, indépendant de la taille du cache et de l'horizon (contre Ω(K) pour FIFO), et un regret d'éviction en O(KT log T), correspondant à la borne inférieure Ω(KT) à des facteurs logarithmiques près. Les expériences montrent une amélioration relative de 5 à 75 % par rapport à FIFO pour des tailles de cache serrées, avec une transition de phase clairement caractérisée à la limite de l'ensemble de travail. Des expériences synthétiques avec des pools de 5000 éléments révèlent en outre une relation en U inversé entre la taille du pool et la qualité de récupération, justifiant les contraintes de capacité comme un phénomène de bruit de récupération plutôt qu'une limitation de stockage.
English
LLM agents increasingly rely on retrieval buffers to store and reuse past experience, yet the cache management policies governing these buffers remain largely ad-hoc. We formalize this as an online semantic cache replacement problem with switching costs, where items are matched by embedding similarity and hit quality is continuous rather than binary. Through experiments on two datasets from MemoryBench-Full (LoCoMo, DialSim) with 8 replacement policies, we reveal a surprising finding: classic heuristics (LRU, LFU) consistently underperform the naive FIFO baseline on semantic workloads, due to the absence of temporal locality and frequency concentration. We propose SOLAR, a learning-augmented framework that derives modification timing from regret accumulation (achieving sim17\% modification rate) and content selection from Bayesian online learning over implicit retrieval feedback. We prove SOLAR achieves a constant competitive ratio leq 3, independent of cache size and horizon (vs.\ Ω(K) for FIFO), and eviction regret O(KTlog T), matching the Ω(KT) lower bound up to logarithmic factors. Experiments demonstrate 5--75\% relative improvement over FIFO at tight cache sizes, with a clearly characterized phase transition at the working set boundary. Synthetic experiments with 5000-item pools further reveal an inverted-U relationship between pool size and retrieval quality, justifying capacity constraints as a retrieval noise phenomenon rather than a storage limitation.