ChatPaper.aiChatPaper

SkillOpt-Lite : Auto-évolution d'agent améliorée et accélérée via une ligne de Vibe

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

July 3, 2026
Auteurs: Yifei Shen, Bo Li, Xinjie Zhang
cs.AI

Résumé

Alors que l'optimisation des compétences des agents autonomes gagne en popularité, les méthodes existantes reposent sur des pipelines complexes. Une question fondamentale reste sans réponse : quel est le pipeline minimal viable pour l'optimisation des compétences, où chaque composant est justifié par la théorie ou la nécessité empirique ? Nous formalisons l'optimisation des compétences via l'optimisation d'ordre zéro (Zeroth-Order, ZO), en faisant le lien entre les contreparties classiques (différence centrale, régions de confiance) et la littérature récente. Notant que, contrairement aux perturbations numériques aveugles de l'optimisation ZO classique, les trajectoires de compétences servent de retour d'information interprétable pour le débogage. Ancré dans la philosophie de Claude Code et l'apprentissage PAC, nous établissons trois principes pour la convergence et la généralisation : exploration de trajectoires basée sur le système de fichiers, extraction d'attributs par consensus et validation indépendante par seuillage. En éliminant les redondances, nous proposons SkillOpt-Lite. Il accélère la convergence et surpasse SkillOpt complet : amélioration de LiveMath de +8,8 points sur GPT-5.5 et de +25,4 points sur GPT-5.4-nano, permettant au modèle nano de surpasser le GPT-5.4 standard optimisé par SkillOpt. Enfin, nous intégrons notre cadre dans des agents de codage en production comme VSCode Copilot, permettant aux développeurs de faire évoluer les compétences des agents via une ligne de *vibe*. Parce que notre cadre traite tous les composants des agents simplement comme du code standard modifiable, ce pipeline minimal se généralise naturellement à l'optimisation complète du harnais (HarnessOpt). Sur SpreadsheetBench, HarnessOpt permet à GPT-5.4-nano d'atteindre une précision de 0,7758, surpassant le plus grand GPT-5.5 utilisant des pipelines standard (0,7620). Le code est disponible à l'adresse https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.
English
While skill optimization for autonomous agents has gained traction, existing methods rely on complex pipelines. This leaves a fundamental question unaddressed: What constitutes a minimal viable pipeline for skill optimization, where every component is justified by theory or empirical necessity? We formalize skill optimization via Zeroth-Order (ZO) optimization, mapping classical counterparts (central difference, trust regions) to recent literature. Noting that unlike blind numerical perturbations in classical ZO, skill trajectories serve as interpretable debugging feedback. Grounded in Claude Code philosophy and PAC learning, we establish three principles for convergence and generalization: file-system-based trajectory exploration, consensus attribute mining, and independent validation gating. Eliminating redundancies, we propose SkillOpt-Lite. It accelerates convergence and outperforms full SkillOpt: improving LiveMath by +8.8 points on GPT-5.5 and +25.4 points on GPT-5.4-nano, allowing the nano model to surpass standard GPT-5.4 optimized by SkillOpt. Finally, we integrate our framework into production coding agents like VSCode Copilot, enabling developers to evolve agent skills via one line of vibe. Because our framework treats all agent components simply as standard editable code, this minimal pipeline naturally generalizes to full harness optimization (HarnessOpt). On SpreadsheetBench, HarnessOpt enables GPT-5.4-nano to achieve 0.7758 accuracy, outperforming the larger GPT-5.5 running standard pipelines (0.7620). Code is available at https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.