EviMem: Bewijskloofgedreven iteratief terugvinden voor langetermijnconversatiegeheugen
EviMem: Evidence-Gap-Driven Iterative Retrieval for Long-Term Conversational Memory
April 30, 2026
Auteurs: Yuyang Li, Yime He, Zeyu Zhang, Dong Gong
cs.AI
Samenvatting
Langdurig gespreksgeheugen vereist het terughalen van bewijsmateriaal dat verspreid is over meerdere sessies, maar een eenmalige ophaling faalt bij temporele en multi-hop vragen. Bestaande iteratieve methoden verfijnen query's via gegenereerde inhoud of documentniveausignalen, maar geen enkele diagnosticeert expliciet de evidentiekloof, namelijk wat er ontbreekt in de verzamelde ophaalset, waardoor queryverfijning ongericht blijft. We presenteren EviMem, dat IRIS (Iterative Retrieval via Insufficiency Signals) combineert, een gesloten-luskader dat evidentiekloof detecteert via toereikendheidsevaluatie, diagnosticeert wat er ontbreekt en gerichte queryverfijning aanstuurt, met LaceMem (Layered Architecture for Conversational Evidence Memory), een grof-naar-fijn geheugenhiërarchie die fijnmazige kloofdiagnose ondersteunt. Op LoCoMo verbetert EviMem de Beoordelaarsnauwkeurigheid ten opzichte van MIRIX bij temporele (73,3% naar 81,6%) en multi-hop (65,9% naar 85,2%) vragen met een 4,5 keer lagere latentie. Code: https://github.com/AIGeeksGroup/EviMem.
English
Long-term conversational memory requires retrieving evidence scattered across multiple sessions, yet single-pass retrieval fails on temporal and multi-hop questions. Existing iterative methods refine queries via generated content or document-level signals, but none explicitly diagnoses the evidence gap, namely what is missing from the accumulated retrieval set, leaving query refinement untargeted. We present EviMem, combining IRIS (Iterative Retrieval via Insufficiency Signals), a closed-loop framework that detects evidence gaps through sufficiency evaluation, diagnoses what is missing, and drives targeted query refinement, with LaceMem (Layered Architecture for Conversational Evidence Memory), a coarse-to-fine memory hierarchy supporting fine-grained gap diagnosis. On LoCoMo, EviMem improves Judge Accuracy over MIRIX on temporal (73.3% to 81.6%) and multi-hop (65.9% to 85.2%) questions at 4.5x lower latency. Code: https://github.com/AIGeeksGroup/EviMem.