Beheer van procedureel geheugen in LLM-agenten: Controle, Aanpassing en Evaluatie
Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation
June 22, 2026
Auteurs: Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko
cs.AI
Samenvatting
Procedureel geheugen wordt steeds vaker gebruikt om LLM-agenten te verbeteren bij terugkerende werktaken, maar het vermogen om herbruikbare vaardigheden te produceren blijft slecht begrepen. Wij introduceren AFTER, een benchmark van 382 realistische enterprisetaken verspreid over zes professionele rollen en 22 procedurele vaardigheden, ontworpen om te evalueren hoe vaardigheden overdragen over taken, rollen en modelbackbones. De benchmark omvat gecontroleerde evaluatieomgevingen voor lokale verbetering, kruistaakoverdracht, kruisroloverdracht en kruismodelgeneralisatie. Experimenten tonen aan dat procedureel geheugen consistente winst oplevert in industriële workflows: een enkele verfijningsronde verbetert de algemene prestatie met 3,7–6,7 punten, terwijl vaardigheden die zijn ontwikkeld uit diverse multi-model uitvoeringssporen een kruismodel testnauwkeurigheid van 73,1% behalen, waarmee ze alle enkelmodel spoorbronnen overtreffen. Verder vinden we dat sommige vaardigheden breed generaliseren over taken en modellen, terwijl andere gespecialiseerd raken in rolspecifieke workflows en effectiviteit verliezen bij overdracht. Deze resultaten bieden praktische richtlijnen voor het bouwen, evalueren en implementeren van procedurele geheugensystemen in productie-agentplatforms.
English
Procedural memory is increasingly used to improve LLM agents on recurring workplace tasks, yet its ability to produce reusable skills remains poorly understood. We introduce AFTER, a benchmark of 382 realistic enterprise tasks spanning six professional roles and 22 procedural skills, designed to evaluate how skills transfer across tasks, roles, and model backbones. The benchmark includes controlled evaluation settings for local improvement, cross-task transfer, cross-role transfer, and cross-model generalization. Experiments show that procedural memory delivers consistent gains in industrial workflows: a single refinement round improves aggregate performance by 3.7-6.7 points, while skills evolved from diverse multi-model execution traces achieve 73.1% cross-model test accuracy, outperforming all single-model trace sources. We further find that some skills generalize broadly across tasks and models, whereas others become specialized to role-specific workflows and lose effectiveness under transfer. These results provide practical guidance for building, evaluating, and deploying procedural memory systems in production agent platforms.