ChatPaper.aiChatPaper

SkillHone: Uma Estrutura para a Evolução Contínua de Habilidades de Agentes Através do Histórico Persistente de Decisões

SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History

June 23, 2026
Autores: Zhiwei Li, Yong Hu
cs.AI

Resumo

As habilidades de agente estendem agentes de modelo de linguagem com procedimentos, scripts e referências específicos de tarefa, mas as tarefas e os ambientes que eles visam mudam continuamente. Métodos existentes melhoram habilidades em execuções limitadas e retêm apenas o artefato final, descartando o histórico de decisões que agentes posteriores precisam para interpretar revisões anteriores, avaliações e alternativas rejeitadas. Apresentamos SkillHone, uma estrutura para evolução contínua de habilidades de agente baseada em histórico persistente de decisões. SkillHone associa revisões de habilidade a evidências do lado da avaliação que fornecem feedback prático, registrando históricos estruturados de diagnósticos, revisões, evidências e resultados. Subagentes com papéis separados executam habilidades candidatas em sondas práticas com relatórios editados e propõem revisões informadas por decisões anteriores, possibilitando refinamento entre sessões sem redescobrir raciocínios passados. Em benchmarks de pesquisa aprofundada, SkillHone opera sem uma pilha de busca pré-integrada e supera o agente de pesquisa aprofundada com suporte comercial em 15,8 pontos no GAIA e 3,2 pontos no WebWalkerQA-EN, além de exceder métodos anteriores de evolução de habilidades. Adicionalmente, implantamos SkillHone em cenários internos de análise mediada por ferramentas, onde melhora a precisão em média 18,8 pontos em sete configurações.
English
Agent skills extend language-model agents with task-specific procedures, scripts, and references, but the tasks and environments they target continually change. Existing methods improve skills in bounded runs and retain only the final artifact, discarding the decision history that later agents need to interpret prior revisions, evaluations, and rejected alternatives. We introduce SkillHone, a harness for continual agent skill evolution grounded in persistent decision history. SkillHone pairs skill revisions with evaluation-side evidence that supplies practice feedback, recording structured histories of diagnoses, revisions, evidence, and outcomes. Role-separated subagents run candidate skills on practice probes with redacted reporting and propose revisions informed by prior decisions, enabling cross-session refinement without rediscovering past rationale. On deep-research benchmarks, SkillHone runs without a pre-integrated search stack and outperforms the commercially backed deep-research agent by 15.8 points on GAIA and 3.2 points on WebWalkerQA-EN, while also exceeding prior skill-evolution methods. We further deploy SkillHone on internal tool-mediated analysis scenarios, where it improves accuracy by an average of 18.8 points across seven settings.