Gerenciamento Dinâmico do Ciclo de Vida de Habilidades para Aprendizado por Reforço Agentivo
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
May 11, 2026
Autores: Junhao Shen, Teng Zhang, Xiaoyan Zhao, Hong Cheng
cs.AI
Resumo
Agentes baseados em grandes modelos de linguagem recorrem cada vez mais a habilidades externas para resolver tarefas complexas, nas quais as habilidades atuam como unidades modulares que ampliam suas capacidades além do que a memória paramétrica isoladamente suporta. Métodos existentes assumem que habilidades externas se acumulam como orientação persistente ou são internalizadas na política, levando eventualmente à inferência sem habilidades. Argumentamos que essa suposição é excessivamente restritiva, pois, dada a capacidade paramétrica limitada e a contribuição marginal desigual entre as habilidades, o conjunto ótimo de habilidades ativas é não monotônico, dependente da tarefa e do estágio. Neste trabalho, propomos SLIM, uma estrutura de gerenciamento dinâmico do ciclo de vida de habilidades (Skill Lifecycle Management) para aprendizado por reforço agentivo, que trata o conjunto ativo de habilidades externas como uma variável de otimização dinâmica atualizada em conjunto com o aprendizado da política. Especificamente, o SLIM estima a contribuição marginal externa de cada habilidade ativa por meio de validação com omissão de uma habilidade por vez e, em seguida, aplica três operações de ciclo de vida: retenção de habilidades de alto valor, aposentadoria de habilidades cuja contribuição se torna desprezível após exposição suficiente e expansão do banco de habilidades quando falhas persistentes revelam lacunas de cobertura de capacidades. Experimentos mostram que o SLIM supera as melhores linhas de base em uma média de 7,1 pontos percentuais nos ambientes ALFWorld e SearchQA. Os resultados indicam ainda que o aprendizado da política e a retenção de habilidades externas não são mutuamente exclusivos: algumas habilidades são absorvidas pela política, enquanto outras continuam a fornecer valor externo, apoiando o SLIM como um paradigma mais geral para aprendizado por reforço agentivo baseado em habilidades.
English
Large language model agents increasingly rely on external skills to solve complex tasks, where skills act as modular units that extend their capabilities beyond what parametric memory alone supports. Existing methods assume external skills either accumulate as persistent guidance or internalized into the policy, eventually leading to zero-skill inference. We argue this assumption is overly restrictive, since with limited parametric capacity and uneven marginal contribution across skills, the optimal active skill set is non-monotonic, task- and stage-dependent. In this work, we propose SLIM, a framework of dynamic Skill LIfecycle Management for agentic reinforcement learning (RL), which treats the active external skill set as a dynamic optimization variable jointly updated with policy learning. Specifically, SLIM estimates each active skill's marginal external contribution through leave-one-skill-out validation, then applies three lifecycle operations: retaining high-value skills, retiring skills whose contribution becomes negligible after sufficient exposure, and expanding the skill bank when persistent failures reveal missing capability coverage. Experiments show that SLIM outperforms the best baselines by an average of 7.1% points across ALFWorld and SearchQA. Results further indicate that policy learning and external skill retention are not mutually exclusive: some skills are absorbed into the policy, while others continue to provide external value, supporting SLIM as a more general paradigm for skill-based agentic RL.