Dynamisch vaardigheidslevenscyclusbeheer voor agentisch reinforcement learning
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
May 11, 2026
Auteurs: Junhao Shen, Teng Zhang, Xiaoyan Zhao, Hong Cheng
cs.AI
Samenvatting
Agenten van grote taalmodellen vertrouwen steeds vaker op externe vaardigheden om complexe taken op te lossen, waarbij vaardigheden fungeren als modulaire eenheden die hun mogelijkheden uitbreiden buiten wat parametrisch geheugen alleen ondersteunt. Bestaande methoden gaan ervan uit dat externe vaardigheden ofwel accumuleren als blijvende begeleiding ofwel worden geïnternaliseerd in het beleid, wat uiteindelijk leidt tot inferentie zonder externe vaardigheden. Wij stellen dat deze aanname overmatig beperkend is, aangezien met een beperkte parametrische capaciteit en ongelijke marginale bijdrage over vaardigheden heen, de optimale actieve vaardighedenset niet-monotoon, taak- en fasenafhankelijk is. In dit werk stellen we SLIM voor, een raamwerk voor dynamisch Vaardigheidslevenscyclusbeheer voor agentische reinforcement learning (RL), dat de actieve externe vaardighedenset behandelt als een dynamische optimalisatievariabele die gezamenlijk met het beleidsleren wordt bijgewerkt. Specifiek schat SLIM de marginale externe bijdrage van elke actieve vaardigheid door middel van leave-one-skill-out validatie, en past vervolgens drie levenscyclusoperaties toe: het behouden van hoogwaardige vaardigheden, het uitfaseren van vaardigheden waarvan de bijdrage verwaarloosbaar wordt na voldoende blootstelling, en het uitbreiden van de vaardighedenbank wanneer aanhoudende mislukkingen een ontbrekende capaciteitsdekking aan het licht brengen. Experimenten tonen aan dat SLIM gemiddeld 7,1 procentpunt beter presteert dan de beste basislijnen over ALFWorld en SearchQA. Resultaten wijzen er verder op dat beleidsleren en het behoud van externe vaardigheden elkaar niet uitsluiten: sommige vaardigheden worden opgenomen in het beleid, terwijl andere externe waarde blijven bieden, wat SLIM ondersteunt als een algemener paradigma voor vaardigheidsgebaseerde agentische RL.
English
Large language model agents increasingly rely on external skills to solve complex tasks, where skills act as modular units that extend their capabilities beyond what parametric memory alone supports. Existing methods assume external skills either accumulate as persistent guidance or internalized into the policy, eventually leading to zero-skill inference. We argue this assumption is overly restrictive, since with limited parametric capacity and uneven marginal contribution across skills, the optimal active skill set is non-monotonic, task- and stage-dependent. In this work, we propose SLIM, a framework of dynamic Skill LIfecycle Management for agentic reinforcement learning (RL), which treats the active external skill set as a dynamic optimization variable jointly updated with policy learning. Specifically, SLIM estimates each active skill's marginal external contribution through leave-one-skill-out validation, then applies three lifecycle operations: retaining high-value skills, retiring skills whose contribution becomes negligible after sufficient exposure, and expanding the skill bank when persistent failures reveal missing capability coverage. Experiments show that SLIM outperforms the best baselines by an average of 7.1% points across ALFWorld and SearchQA. Results further indicate that policy learning and external skill retention are not mutually exclusive: some skills are absorbed into the policy, while others continue to provide external value, supporting SLIM as a more general paradigm for skill-based agentic RL.