ChatPaper.aiChatPaper

DuoMem: Op weg naar capabele on-device geheugenagenten via dual-space distillatie

DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation

June 29, 2026
Auteurs: Peyman Hosseini, Ondrej Bohdal, Ahmed Alajrami, Andrea Maracani, Ignacio Castro, Matthew Purver, Mete Ozay, Savas Ozkan, Taha Ceritli
cs.AI

Samenvatting

Agenten gebaseerd op grote taalmodellen (LLM) kunnen complexe procedurele taken oplossen door gedurende meerdere stappen interactie met omgevingen, maar dit vermogen is doorgaans afhankelijk van grote modellen, lange contexten en herhaalde inferentieaanroepen. Dit maakt geavanceerde geheugenversterkte agenten moeilijk inzetbaar op apparaten met beperkte middelen. We introduceren DuoMem, een dual-space distillatiekader dat procedureel probleemoplossend vermogen overdraagt van een groot leraarmodel naar compacte studentmodellen. DuoMem distilleert in twee complementaire ruimtes: (1) contextruimte-distillatie, waarbij door studenten gegenereerde herinneringen worden vervangen door kwalitatief betere, door de leraar gegenereerde procedurele herinneringen die aan de invoer van de student worden voorgevoegd, en (2) parameterruimte-distillatie, waarbij lichtgewicht LoRA-adapters worden fijngesteld op succesvolle lerarentrajecten. Geëvalueerd op ALFWorld, een uitdagende belichaamde besluitvormingsbenchmark, verbetert DuoMem een 4B-parametermodel van 4,3% naar 77,9% taaksuccesspercentage, waarmee het grootste deel van de kloof met een 72B-leraarmodel (87,1%) wordt gedicht, terwijl er minder dan 10M trainbare parameters en slechts enkele megabytes aan voorberekende lerarenherinneringen worden toegevoegd. Bovendien voltooit het met DuoMem verbeterde 4B-model taken meer dan 3x sneller dan de 72B-leraar in verstreken tijd, waardoor het levensvatbaar is voor real-time edge-implementatie, wat voor de leraar een uitdaging zou zijn. Uitgebreide ablatiestudies over acht modellen variërend van 2B-72B parameters tonen aan dat beide distillatieassen complementaire bijdragen leveren.
English
Large Language Model (LLM)-based agents can solve complex procedural tasks by interacting with environments over multiple turns, but this ability typically depends on large models, long contexts, and repeated inference calls. This makes advanced memory-augmented agents difficult to deploy on resource-constrained devices. We introduce DuoMem, a dual-space distillation framework that transfers procedural problem-solving ability from a large teacher model to compact student models. DuoMem distils in two complementary spaces: (1)context-space distillation, which replaces student-generated memories with higher-quality teacher-generated procedural memories prepended to the student's input, and (2)parameter-space distillation, which fine-tunes lightweight LoRA adapters on successful teacher trajectories. Evaluated on ALFWorld, a challenging embodied decision-making benchmark, DuoMem boosts a 4B-parameter model from 4.3% to 77.9% task success rate, closing most of the gap to a 72B teacher model (87.1%), while adding fewer than 10M trainable parameters and only a few megabytes of pre-computed teacher memories. Moreover, the DuoMem-enhanced 4B model completes tasks over 3x faster than the 72B teacher in wall-clock time, making it viable for real-time edge deployment, which would be challenging for the teacher.Extensive ablations across eight models spanning 2B-72B parameters reveal that both distillation axes contribute complementary