SkillHone: Een harnas voor continue vaardigheidsevolutie van agenten via persistente beslissingsgeschiedenis
SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History
June 23, 2026
Auteurs: Zhiwei Li, Yong Hu
cs.AI
Samenvatting
Agentvaardigheden breiden taalmodelagenten uit met taakspecifieke procedures, scripts en referenties, maar de taken en omgevingen waarop ze zich richten veranderen voortdurend. Bestaande methoden verbeteren vaardigheden in begrensde runs en bewaren alleen het uiteindelijke artefact, waarbij ze de beslissingsgeschiedenis weggooien die latere agenten nodig hebben om eerdere herzieningen, evaluaties en afgewezen alternatieven te interpreteren. Wij introduceren SkillHone, een harnas voor voortdurende evolutie van agentvaardigheden, gebaseerd op een persistente beslissingsgeschiedenis. SkillHone koppelt vaardigheidsherzieningen aan evaluatiezijde bewijs dat praktijkfeedback levert, en legt gestructureerde geschiedenissen vast van diagnoses, herzieningen, bewijs en uitkomsten. Rolgescheiden subagenten laten kandidaatvaardigheden draaien op praktijktests met geredigeerde rapportage en stellen herzieningen voor op basis van eerdere beslissingen, waardoor verfijning over sessies heen mogelijk wordt zonder het herontdekken van eerdere redeneringen. Op diepgaande onderzoeksbenchmarks draait SkillHone zonder een vooraf geïntegreerde zoekstack en presteert het 15,8 punten beter dan de commercieel ondersteunde diepgaande onderzoeksagent op GAIA en 3,2 punten op WebWalkerQA-EN, terwijl het ook eerdere vaardigheidsevolutiemethoden overtreft. Verder zetten wij SkillHone in op interne tool-gemedieerde analysescenario's, waar het de nauwkeurigheid met gemiddeld 18,8 punten verbetert over zeven instellingen.
English
Agent skills extend language-model agents with task-specific procedures, scripts, and references, but the tasks and environments they target continually change. Existing methods improve skills in bounded runs and retain only the final artifact, discarding the decision history that later agents need to interpret prior revisions, evaluations, and rejected alternatives. We introduce SkillHone, a harness for continual agent skill evolution grounded in persistent decision history. SkillHone pairs skill revisions with evaluation-side evidence that supplies practice feedback, recording structured histories of diagnoses, revisions, evidence, and outcomes. Role-separated subagents run candidate skills on practice probes with redacted reporting and propose revisions informed by prior decisions, enabling cross-session refinement without rediscovering past rationale. On deep-research benchmarks, SkillHone runs without a pre-integrated search stack and outperforms the commercially backed deep-research agent by 15.8 points on GAIA and 3.2 points on WebWalkerQA-EN, while also exceeding prior skill-evolution methods. We further deploy SkillHone on internal tool-mediated analysis scenarios, where it improves accuracy by an average of 18.8 points across seven settings.