Gestion dynamique du cycle de vie des compétences pour l'apprentissage par renforcement agentique
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
May 11, 2026
Auteurs: Junhao Shen, Teng Zhang, Xiaoyan Zhao, Hong Cheng
cs.AI
Résumé
Les agents de grands modèles de langage s'appuient de plus en plus sur des compétences externes pour résoudre des tâches complexes, où ces compétences agissent comme des unités modulaires étendant leurs capacités au-delà de ce que la seule mémoire paramétrique permet. Les méthodes existantes supposent que les compétences externes s'accumulent soit comme un guidage persistant, soit s'intègrent dans la politique, menant finalement à une inférence sans compétence. Nous soutenons que cette hypothèse est trop restrictive, car avec une capacité paramétrique limitée et une contribution marginale inégale entre les compétences, l'ensemble optimal de compétences actives est non monotone, dépendant de la tâche et de l'étape. Dans ce travail, nous proposons SLIM, un cadre de gestion dynamique du cycle de vie des compétences pour l'apprentissage par renforcement (RL) agentique, qui traite l'ensemble des compétences externes actives comme une variable d'optimisation dynamique mise à jour conjointement avec l'apprentissage de la politique. Plus précisément, SLIM estime la contribution marginale externe de chaque compétence active par validation par retrait d'une compétence, puis applique trois opérations de cycle de vie : la conservation des compétences à haute valeur, le retrait des compétences dont la contribution devient négligeable après une exposition suffisante, et l'extension du répertoire de compétences lorsque des échecs persistants révèlent un manque de couverture capacitaire. Les expériences montrent que SLIM surpasse les meilleures références de 7,1 points de pourcentage en moyenne sur ALFWorld et SearchQA. Les résultats indiquent en outre que l'apprentissage de la politique et la rétention de compétences externes ne s'excluent pas mutuellement : certaines compétences sont absorbées dans la politique, tandis que d'autres continuent d'apporter une valeur externe, soutenant SLIM en tant que paradigme plus général pour le RL agentique basé sur les compétences.
English
Large language model agents increasingly rely on external skills to solve complex tasks, where skills act as modular units that extend their capabilities beyond what parametric memory alone supports. Existing methods assume external skills either accumulate as persistent guidance or internalized into the policy, eventually leading to zero-skill inference. We argue this assumption is overly restrictive, since with limited parametric capacity and uneven marginal contribution across skills, the optimal active skill set is non-monotonic, task- and stage-dependent. In this work, we propose SLIM, a framework of dynamic Skill LIfecycle Management for agentic reinforcement learning (RL), which treats the active external skill set as a dynamic optimization variable jointly updated with policy learning. Specifically, SLIM estimates each active skill's marginal external contribution through leave-one-skill-out validation, then applies three lifecycle operations: retaining high-value skills, retiring skills whose contribution becomes negligible after sufficient exposure, and expanding the skill bank when persistent failures reveal missing capability coverage. Experiments show that SLIM outperforms the best baselines by an average of 7.1% points across ALFWorld and SearchQA. Results further indicate that policy learning and external skill retention are not mutually exclusive: some skills are absorbed into the policy, while others continue to provide external value, supporting SLIM as a more general paradigm for skill-based agentic RL.