SkillOpt-Lite: Улучшенная и более быстрая самоэволюция агента с помощью одной строки Vibe
SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe
July 3, 2026
Авторы: Yifei Shen, Bo Li, Xinjie Zhang
cs.AI
Аннотация
Хотя оптимизация навыков для автономных агентов привлекла внимание, существующие методы опираются на сложные конвейеры. Это оставляет без ответа фундаментальный вопрос: что составляет минимально жизнеспособный конвейер для оптимизации навыков, где каждый компонент обоснован теорией или эмпирической необходимостью? Мы формализуем оптимизацию навыков с помощью оптимизации нулевого порядка (ZO), сопоставляя классические аналоги (центральная разность, доверительные области) с недавней литературой. Отмечая, что в отличие от слепых численных возмущений в классической ZO, траектории навыков служат интерпретируемой отладочной обратной связью. Основываясь на философии Claude Code и PAC-обучении, мы устанавливаем три принципа сходимости и обобщения: исследование траекторий на основе файловой системы, анализ консенсусных атрибутов и независимый валидационный шлюз. Устраняя избыточность, мы предлагаем SkillOpt-Lite. Он ускоряет сходимость и превосходит полный SkillOpt: улучшая LiveMath на +8.8 баллов на GPT-5.5 и на +25.4 балла на GPT-5.4-nano, позволяя nano-модели превзойти стандартный GPT-5.4, оптимизированный с помощью SkillOpt. Наконец, мы интегрируем наш фреймворк в продукционные кодирующие агенты, такие как VSCode Copilot, позволяя разработчикам эволюционировать навыки агентов одной строкой кода. Поскольку наш фреймворк рассматривает все компоненты агента просто как стандартный редактируемый код, этот минимальный конвейер естественным образом обобщается до оптимизации полного окружения (HarnessOpt). На SpreadsheetBench HarnessOpt позволяет GPT-5.4-nano достичь точности 0.7758, превзойдя более крупный GPT-5.5, работающий на стандартных конвейерах (0.7620). Код доступен по адресу https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.
English
While skill optimization for autonomous agents has gained traction, existing methods rely on complex pipelines. This leaves a fundamental question unaddressed: What constitutes a minimal viable pipeline for skill optimization, where every component is justified by theory or empirical necessity? We formalize skill optimization via Zeroth-Order (ZO) optimization, mapping classical counterparts (central difference, trust regions) to recent literature. Noting that unlike blind numerical perturbations in classical ZO, skill trajectories serve as interpretable debugging feedback. Grounded in Claude Code philosophy and PAC learning, we establish three principles for convergence and generalization: file-system-based trajectory exploration, consensus attribute mining, and independent validation gating. Eliminating redundancies, we propose SkillOpt-Lite. It accelerates convergence and outperforms full SkillOpt: improving LiveMath by +8.8 points on GPT-5.5 and +25.4 points on GPT-5.4-nano, allowing the nano model to surpass standard GPT-5.4 optimized by SkillOpt. Finally, we integrate our framework into production coding agents like VSCode Copilot, enabling developers to evolve agent skills via one line of vibe. Because our framework treats all agent components simply as standard editable code, this minimal pipeline naturally generalizes to full harness optimization (HarnessOpt). On SpreadsheetBench, HarnessOpt enables GPT-5.4-nano to achieve 0.7758 accuracy, outperforming the larger GPT-5.5 running standard pipelines (0.7620). Code is available at https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.