SkillOpt-Lite: Betere en Snellere Zelfevolutie van Agenten via één Vibe-regel
SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe
July 3, 2026
Auteurs: Yifei Shen, Bo Li, Xinjie Zhang
cs.AI
Samenvatting
Hoewel vaardigheidsoptimalisatie voor autonome agenten aan populariteit wint, vertrouwen bestaande methoden op complexe pijplijnen. Dit laat een fundamentele vraag onbeantwoord: wat vormt een minimaal levensvatbare pijplijn voor vaardigheidsoptimalisatie, waarbij elk onderdeel wordt gerechtvaardigd door theorie of empirische noodzaak? Wij formaliseren vaardigheidsoptimalisatie via nulde-orde (ZO) optimalisatie en brengen klassieke tegenhangers (centrale differentie, trustregio's) in kaart naar recente literatuur. Opmerkend dat vaardigheidstrajecten, in tegenstelling tot blinde numerieke verstoringen in klassieke ZO, dienen als interpreteerbare debug-feedback. Geworteld in de Claude Code-filosofie en PAC-leren, stellen we drie principes vast voor convergentie en generalisatie: bestandssysteemgebaseerde trajectverkenning, consensuskenmerkmijnbouw en onafhankelijke validatiedrempels. Door redundanties weg te nemen, stellen we SkillOpt-Lite voor. Het versnelt convergentie en presteert beter dan het volledige SkillOpt: een verbetering van +8,8 punten op LiveMath met GPT-5.5 en +25,4 punten met GPT-5.4-nano, waardoor het nano-model de standaard GPT-5.4 verslaat die door SkillOpt is geoptimaliseerd. Tot slot integreren we ons raamwerk in productiecodeagenten zoals VSCode Copilot, waarmee ontwikkelaars agentvaardigheden kunnen evolueren via één regel 'vibe'. Omdat ons raamwerk alle agentcomponenten simpelweg als standaard bewerkbare code behandelt, generaliseert deze minimale pijplijn op natuurlijke wijze naar volledige harnasoptimalisatie (HarnessOpt). Op SpreadsheetBench stelt HarnessOpt GPT-5.4-nano in staat een nauwkeurigheid van 0,7758 te behalen, waarmee de grotere GPT-5.5 met standaardpijplijnen (0,7620) wordt overtroffen. Code is beschikbaar op https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.
English
While skill optimization for autonomous agents has gained traction, existing methods rely on complex pipelines. This leaves a fundamental question unaddressed: What constitutes a minimal viable pipeline for skill optimization, where every component is justified by theory or empirical necessity? We formalize skill optimization via Zeroth-Order (ZO) optimization, mapping classical counterparts (central difference, trust regions) to recent literature. Noting that unlike blind numerical perturbations in classical ZO, skill trajectories serve as interpretable debugging feedback. Grounded in Claude Code philosophy and PAC learning, we establish three principles for convergence and generalization: file-system-based trajectory exploration, consensus attribute mining, and independent validation gating. Eliminating redundancies, we propose SkillOpt-Lite. It accelerates convergence and outperforms full SkillOpt: improving LiveMath by +8.8 points on GPT-5.5 and +25.4 points on GPT-5.4-nano, allowing the nano model to surpass standard GPT-5.4 optimized by SkillOpt. Finally, we integrate our framework into production coding agents like VSCode Copilot, enabling developers to evolve agent skills via one line of vibe. Because our framework treats all agent components simply as standard editable code, this minimal pipeline naturally generalizes to full harness optimization (HarnessOpt). On SpreadsheetBench, HarnessOpt enables GPT-5.4-nano to achieve 0.7758 accuracy, outperforming the larger GPT-5.5 running standard pipelines (0.7620). Code is available at https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.