ChatPaper.aiChatPaper

Skills-Coach: Um Otimizador de Habilidades de Auto-Evolução via GRPO sem Treinamento

Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO

April 30, 2026
Autores: Yu Tian, Jiawei Chen, Lifan Zheng, Mingxiang Tao, Xinyi Zeng, Zhaoxia Yin, Hang Su, Xian Sun
cs.AI

Resumo

Apresentamos o Skills-Coach, uma nova estrutura automatizada concebida para melhorar significativamente a auto-evolução de competências em agentes baseados em Modelos de Linguagem de Grande Escala (LLM). Abordando a atual fragmentação do ecossistema de competências, o Skills-Coach explora os limites das capacidades das mesmas, facilitando assim a cobertura abrangente de competências essencial para aplicações inteligentes. A estrutura compreende quatro módulos principais: um Módulo de Geração de Tarefas Diversas que cria sistematicamente uma suíte de testes abrangente para várias competências; um Módulo de Otimização Leve dedicado à otimização de instruções (prompts) de competências e seu código correspondente; um Módulo de Execução Comparativa que facilita a execução e avaliação de competências originais e otimizadas; e um Módulo de Avaliação Rastreável, que avalia rigorosamente o desempenho face a critérios especificados. O Skills-Coach oferece opções de execução flexíveis através dos seus modos virtual e real. Para validar a sua eficácia, apresentamos o Skill-X, um conjunto de dados de referência abrangente composto por 48 competências diversas. Resultados experimentais demonstram que o Skills-Coach alcança melhorias significativas de desempenho na capacidade das competências numa ampla gama de categorias, destacando o seu potencial para avançar o desenvolvimento de agentes baseados em LLM mais robustos e adaptáveis.
English
We introduce Skills-Coach, a novel automated framework designed to significantly enhance the self-evolution of skills within Large Language Model (LLM)-based agents. Addressing the current fragmentation of the skill ecosystem, Skills-Coach explores the boundaries of skill capabilities, thereby facilitating the comprehensive competency coverage essential for intelligent applications. The framework comprises four core modules: a Diverse Task Generation Module that systematically creates a comprehensive test suite for various skills; a Lightweight Optimization Module dedicated to optimizing skill prompts and their corresponding code; a Comparative Execution Module facilitating the execution and evaluation of both original and optimized skills; and a Traceable Evaluation Module, which rigorously evaluates performance against specified criteria. Skills-Coach offers flexible execution options through its virtual and real modes. To validate its efficacy, we introduce Skill-X, a comprehensive benchmark dataset consisting of 48 diverse skills. Experimental results demonstrate that Skills-Coach achieves significant performance improvements in skill capability across a wide range of categories, highlighting its potential to advance the development of more robust and adaptable LLM-based agents.