Habilidade1: Evolução Unificada de Agentes Aumentados por Habilidades via Aprendizagem por Reforço
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
May 7, 2026
Autores: Yaorui Shi, Yuxin Chen, Zhengxi Lu, Yuchun Miao, Shugui Liu, Qi GU, Xunliang Cai, Xiang Wang, An Zhang
cs.AI
Resumo
Uma biblioteca de habilidades persistentes permite que agentes de modelos de linguagem reutilizem estratégias bem-sucedidas em diferentes tarefas. A manutenção de tal biblioteca requer três capacidades acopladas. O agente seleciona uma habilidade relevante, utiliza-a durante a execução e destila novas habilidades a partir da experiência. Os métodos existentes otimizam essas capacidades de forma isolada ou com fontes de recompensa separadas, resultando numa evolução parcial e conflituosa. Propomos o Skill1, uma estrutura que treina uma única política para co-evoluir a seleção, utilização e destilação de habilidades em direção a um objetivo compartilhado de resultado da tarefa. A política gera uma consulta para pesquisar a biblioteca de habilidades, reclassifica os candidatos para selecionar um, resolve a tarefa condicionada a ela e destila uma nova habilidade a partir da trajetória. Todo o aprendizado deriva de um único sinal de resultado da tarefa. A sua tendência de baixa frequência credita a seleção e a sua variação de alta frequência credita a destilação. Experimentos no ALFWorld e no WebShop mostram que o Skill1 supera as linhas de base anteriores baseadas em habilidades e em aprendizagem por reforço. A dinâmica de treino confirma a co-evolução das três capacidades, e as ablações mostram que a remoção de qualquer sinal de crédito degrada a evolução.
English
A persistent skill library allows language model agents to reuse successful strategies across tasks. Maintaining such a library requires three coupled capabilities. The agent selects a relevant skill, utilizes it during execution, and distills new skills from experience. Existing methods optimize these capabilities in isolation or with separate reward sources, resulting in partial and conflicting evolution. We propose Skill1, a framework that trains a single policy to co-evolve skill selection, utilization, and distillation toward a shared task-outcome objective. The policy generates a query to search the skill library, re-ranks candidates to select one, solves the task conditioned on it, and distills a new skill from the trajectory. All learning derives from a single task-outcome signal. Its low-frequency trend credits selection and its high-frequency variation credits distillation. Experiments on ALFWorld and WebShop show that Skill1 outperforms prior skill-based and reinforcement learning baselines. Training dynamics confirm the co-evolution of the three capabilities, and ablations show that removing any credit signal degrades the evolution.