ChatPaper.aiChatPaper

Gerenciamento da Memória Processual em Agentes de LLM: Controle, Adaptação e Avaliação

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

June 22, 2026
Autores: Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko
cs.AI

Resumo

A memória procedural é cada vez mais utilizada para aprimorar agentes LLM em tarefas recorrentes no ambiente de trabalho, mas sua capacidade de gerar habilidades reutilizáveis ainda é pouco compreendida. Apresentamos o AFTER, um benchmark composto por 382 tarefas empresariais realistas, abrangendo seis funções profissionais e 22 habilidades processuais, projetado para avaliar como as habilidades são transferidas entre tarefas, funções e modelos base. O benchmark inclui ambientes de avaliação controlada para melhoria local, transferência entre tarefas, transferência entre funções e generalização entre modelos. Experimentos mostram que a memória procedural proporciona ganhos consistentes em fluxos de trabalho industriais: uma única rodada de refinamento melhora o desempenho agregado em 3,7 a 6,7 pontos, enquanto habilidades evoluídas a partir de traços de execução multimodelo diversos alcançam 73,1% de precisão em testes entre modelos, superando todas as fontes de traços de modelo único. Constatamos ainda que algumas habilidades generalizam amplamente entre tarefas e modelos, enquanto outras se especializam em fluxos de trabalho específicos de função e perdem eficácia sob transferência. Esses resultados fornecem orientações práticas para construir, avaliar e implantar sistemas de memória procedural em plataformas de agentes em produção.
English
Procedural memory is increasingly used to improve LLM agents on recurring workplace tasks, yet its ability to produce reusable skills remains poorly understood. We introduce AFTER, a benchmark of 382 realistic enterprise tasks spanning six professional roles and 22 procedural skills, designed to evaluate how skills transfer across tasks, roles, and model backbones. The benchmark includes controlled evaluation settings for local improvement, cross-task transfer, cross-role transfer, and cross-model generalization. Experiments show that procedural memory delivers consistent gains in industrial workflows: a single refinement round improves aggregate performance by 3.7-6.7 points, while skills evolved from diverse multi-model execution traces achieve 73.1% cross-model test accuracy, outperforming all single-model trace sources. We further find that some skills generalize broadly across tasks and models, whereas others become specialized to role-specific workflows and lose effectiveness under transfer. These results provide practical guidance for building, evaluating, and deploying procedural memory systems in production agent platforms.