SkillOS: Aprendizagem de Curadoria de Habilidades para Agentes de Auto-evolução
SkillOS: Learning Skill Curation for Self-Evolving Agents
May 7, 2026
Autores: Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee
cs.AI
Resumo
Os agentes baseados em LLM estão sendo cada vez mais implantados para lidar com tarefas de fluxo contínuo, mas frequentemente permanecem como solucionadores de problemas pontuais que não aprendem com interações passadas. Habilidades reutilizáveis, destiladas da experiência, fornecem um substrato natural para a auto-evolução, onde a curadoria de habilidades de alta qualidade atua como o principal gargalo. As abordagens existentes ou dependem de curadoria manual de habilidades, prescrevem operações heurísticas de habilidades ou treinam operações de habilidades de curto prazo. No entanto, elas ainda lutam para aprender políticas complexas de curadoria de longo prazo a partir de feedback indireto e atrasado. Para enfrentar esse desafio, propomos o SkillOS, uma receita de treinamento por RL (Reinforcement Learning) orientada por experiência para aprender curadoria de habilidades em agentes auto-evolutivos. O SkillOS emparelha um executor de agente congelado que recupera e aplica habilidades com um curador de habilidades treinável que atualiza um SkillRepo externo a partir da experiência acumulada. Para fornecer sinais de aprendizado para a curadoria, projetamos recompensas compostas e treinamos em fluxos de tarefas agrupadas com base em dependências de tarefas relevantes para habilidades, onde trajetórias anteriores atualizam o SkillRepo e tarefas relacionadas subsequentes avaliam essas atualizações. Em tarefas agentivas multi-turno e tarefas de raciocínio de turno único, o SkillOS supera consistentemente as linhas de base sem memória e com memória robusta, tanto em eficácia quanto em eficiência, com o curador de habilidades aprendido generalizando-se através de diferentes *backbones* de executores e domínios de tarefas. Análises adicionais mostram que o curador aprendido produz um uso de habilidades mais direcionado, enquanto as habilidades no SkillRepo evoluem para arquivos Markdown com estrutura mais rica que codificam meta-habilidades de nível superior ao longo do tempo.
English
LLM-based agents are increasingly deployed to handle streaming tasks, yet they often remain one-off problem solvers that fail to learn from past interactions. Reusable skills distilled from experience provide a natural substrate for self-evolution, where high-quality skill curation serves as the key bottleneck. Existing approaches either rely on manual skill curation, prescribe heuristic skill operations, or train for short-horizon skill operations. However, they still struggle to learn complex long-term curation policies from indirect and delayed feedback. To tackle this challenge, we propose SkillOS, an experience-driven RL training recipe for learning skill curation in self-evolving agents. SkillOS pairs a frozen agent executor that retrieves and applies skills with a trainable skill curator that updates an external SkillRepo from accumulated experience. To provide learning signals for curation, we design composite rewards and train on grouped task streams based on skill-relevant task dependencies, where earlier trajectories update the SkillRepo, and later related tasks evaluate these updates. Across multi-turn agentic tasks and single-turn reasoning tasks, SkillOS consistently outperforms memory-free and strong memory-based baselines in both effectiveness and efficiency, with the learned skill curator generalizing across different executor backbones and task domains. Further analyses show that the learned curator produces more targeted skill use, while the skills in SkillRepo evolve into more richly structured Markdown files that encode higher-level meta-skills over time.