Cuando las políticas de caché clásicas fallan: reemplazo aumentado con aprendizaje para búferes de recuperación semántica
When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers
July 1, 2026
Autores: Yushi Sun, Bowen Cao, Wai Lam
cs.AI
Resumen
Los agentes basados en modelos de lenguaje grande (LLM) recurren cada vez más a búferes de recuperación para almacenar y reutilizar experiencias pasadas, pero las políticas de gestión de caché que rigen estos búferes siguen siendo en gran medida ad hoc. Formalizamos este problema como un problema de reemplazo de caché semántico en línea con costos de conmutación, donde los elementos se emparejan por similitud de incrustaciones y la calidad de acierto es continua en lugar de binaria. Mediante experimentos en dos conjuntos de datos de MemoryBench-Full (LoCoMo, DialSim) con 8 políticas de reemplazo, revelamos un hallazgo sorprendente: los heurísticos clásicos (LRU, LFU) tienen un rendimiento consistentemente inferior al de la línea base ingenua FIFO en cargas de trabajo semánticas, debido a la ausencia de localidad temporal y concentración de frecuencias. Proponemos SOLAR, un marco aumentado con aprendizaje que obtiene el momento de modificación a partir de la acumulación de arrepentimiento (logrando una tasa de modificación del sim17%) y la selección de contenido mediante aprendizaje bayesiano en línea a partir de retroalimentación de recuperación implícita. Demostramos que SOLAR alcanza una razón competitiva constante ≤ 3, independiente del tamaño de caché y del horizonte (frente a Ω(K) para FIFO), y un arrepentimiento de desalojo de O(KT log T), que iguala la cota inferior Ω(KT) salvo factores logarítmicos. Los experimentos muestran una mejora relativa del 5–75% frente a FIFO en tamaños de caché ajustados, con una transición de fase claramente caracterizada en el límite del conjunto de trabajo. Experimentos sintéticos con conjuntos de 5000 elementos revelan además una relación en forma de U invertida entre el tamaño del conjunto y la calidad de recuperación, lo que justifica las restricciones de capacidad como un fenómeno de ruido de recuperación, más que como una limitación de almacenamiento.
English
LLM agents increasingly rely on retrieval buffers to store and reuse past experience, yet the cache management policies governing these buffers remain largely ad-hoc. We formalize this as an online semantic cache replacement problem with switching costs, where items are matched by embedding similarity and hit quality is continuous rather than binary. Through experiments on two datasets from MemoryBench-Full (LoCoMo, DialSim) with 8 replacement policies, we reveal a surprising finding: classic heuristics (LRU, LFU) consistently underperform the naive FIFO baseline on semantic workloads, due to the absence of temporal locality and frequency concentration. We propose SOLAR, a learning-augmented framework that derives modification timing from regret accumulation (achieving sim17\% modification rate) and content selection from Bayesian online learning over implicit retrieval feedback. We prove SOLAR achieves a constant competitive ratio leq 3, independent of cache size and horizon (vs.\ Ω(K) for FIFO), and eviction regret O(KTlog T), matching the Ω(KT) lower bound up to logarithmic factors. Experiments demonstrate 5--75\% relative improvement over FIFO at tight cache sizes, with a clearly characterized phase transition at the working set boundary. Synthetic experiments with 5000-item pools further reveal an inverted-U relationship between pool size and retrieval quality, justifying capacity constraints as a retrieval noise phenomenon rather than a storage limitation.