ChatPaper.aiChatPaper

Quando as Políticas Clássicas de Cache Falham: Substituição Aumentada por Aprendizado para Buffers de Recuperação Semântica

When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers

July 1, 2026
Autores: Yushi Sun, Bowen Cao, Wai Lam
cs.AI

Resumo

Agentes de LLM dependem cada vez mais de buffers de recuperação para armazenar e reutilizar experiências passadas, no entanto, as políticas de gerenciamento de cache que regem esses buffers permanecem em grande parte ad-hoc. Formalizamos isso como um problema de substituição de cache semântico online com custos de comutação, onde itens são combinados por similaridade de embeddings e a qualidade de acerto é contínua, em vez de binária. Por meio de experimentos em dois conjuntos de dados do MemoryBench-Full (LoCoMo, DialSim) com 8 políticas de substituição, revelamos uma descoberta surpreendente: as heurísticas clássicas (LRU, LFU) consistentemente têm desempenho inferior à linha de base ingênua FIFO em cargas de trabalho semânticas, devido à ausência de localidade temporal e concentração de frequência. Propomos SOLAR, um framework aumentado por aprendizado que deriva o tempo de modificação a partir da acumulação de arrependimento (alcançando uma taxa de modificação de sim 17%) e a seleção de conteúdo a partir do aprendizado online bayesiano sobre feedback implícito de recuperação. Provamos que o SOLAR atinge uma razão competitiva constante ≤ 3, independente do tamanho do cache e do horizonte (vs. Ω(K) para FIFO), e arrependimento de despejo O(KT log T), correspondendo ao limite inferior Ω(KT) a menos de fatores logarítmicos. Experimentos demonstram melhoria relativa de 5 a 75% sobre o FIFO em tamanhos de cache restritos, com uma transição de fase claramente caracterizada no limite do conjunto de trabalho. Experimentos sintéticos com pools de 5000 itens revelam ainda uma relação em U invertido entre o tamanho do pool e a qualidade de recuperação, justificando as restrições de capacidade como um fenômeno de ruído de recuperação, em vez de uma limitação de armazenamento.
English
LLM agents increasingly rely on retrieval buffers to store and reuse past experience, yet the cache management policies governing these buffers remain largely ad-hoc. We formalize this as an online semantic cache replacement problem with switching costs, where items are matched by embedding similarity and hit quality is continuous rather than binary. Through experiments on two datasets from MemoryBench-Full (LoCoMo, DialSim) with 8 replacement policies, we reveal a surprising finding: classic heuristics (LRU, LFU) consistently underperform the naive FIFO baseline on semantic workloads, due to the absence of temporal locality and frequency concentration. We propose SOLAR, a learning-augmented framework that derives modification timing from regret accumulation (achieving sim17\% modification rate) and content selection from Bayesian online learning over implicit retrieval feedback. We prove SOLAR achieves a constant competitive ratio leq 3, independent of cache size and horizon (vs.\ Ω(K) for FIFO), and eviction regret O(KTlog T), matching the Ω(KT) lower bound up to logarithmic factors. Experiments demonstrate 5--75\% relative improvement over FIFO at tight cache sizes, with a clearly characterized phase transition at the working set boundary. Synthetic experiments with 5000-item pools further reveal an inverted-U relationship between pool size and retrieval quality, justifying capacity constraints as a retrieval noise phenomenon rather than a storage limitation.