ChatPaper.aiChatPaper

SkillOpt-Lite: Mejor y más rápida auto-evolución de agentes mediante una línea de Vibe

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

July 3, 2026
Autores: Yifei Shen, Bo Li, Xinjie Zhang
cs.AI

Resumen

Si bien la optimización de habilidades para agentes autónomos ha ganado relevancia, los métodos existentes dependen de complejos pipelines. Esto deja sin abordar una pregunta fundamental: ¿Qué constituye un pipeline mínimo viable para la optimización de habilidades, donde cada componente esté justificado por teoría o necesidad empírica? Formalizamos la optimización de habilidades mediante optimización de orden cero (ZO), mapeando contrapartes clásicas (diferencia central, regiones de confianza) a la literatura reciente. Observamos que, a diferencia de las perturbaciones numéricas ciegas en la ZO clásica, las trayectorias de habilidades sirven como retroalimentación de depuración interpretable. Basándonos en la filosofía de Claude Code y el aprendizaje PAC, establecemos tres principios para la convergencia y generalización: exploración de trayectorias basada en sistema de archivos, minería de atributos por consenso y compuerta de validación independiente. Eliminando redundancias, proponemos SkillOpt-Lite. Acelera la convergencia y supera a SkillOpt completo: mejora LiveMath en +8.8 puntos en GPT-5.5 y +25.4 puntos en GPT-5.4-nano, permitiendo que el modelo nano supere al GPT-5.4 estándar optimizado por SkillOpt. Finalmente, integramos nuestro marco en agentes de codificación en producción como VSCode Copilot, permitiendo a los desarrolladores evolucionar las habilidades del agente mediante una línea de vibe. Debido a que nuestro marco trata todos los componentes del agente simplemente como código editable estándar, este pipeline mínimo se generaliza naturalmente a la optimización completa del arnés (HarnessOpt). En SpreadsheetBench, HarnessOpt permite que GPT-5.4-nano alcance una precisión de 0.7758, superando al GPT-5.5 más grande que ejecuta pipelines estándar (0.7620). El código está disponible en https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.
English
While skill optimization for autonomous agents has gained traction, existing methods rely on complex pipelines. This leaves a fundamental question unaddressed: What constitutes a minimal viable pipeline for skill optimization, where every component is justified by theory or empirical necessity? We formalize skill optimization via Zeroth-Order (ZO) optimization, mapping classical counterparts (central difference, trust regions) to recent literature. Noting that unlike blind numerical perturbations in classical ZO, skill trajectories serve as interpretable debugging feedback. Grounded in Claude Code philosophy and PAC learning, we establish three principles for convergence and generalization: file-system-based trajectory exploration, consensus attribute mining, and independent validation gating. Eliminating redundancies, we propose SkillOpt-Lite. It accelerates convergence and outperforms full SkillOpt: improving LiveMath by +8.8 points on GPT-5.5 and +25.4 points on GPT-5.4-nano, allowing the nano model to surpass standard GPT-5.4 optimized by SkillOpt. Finally, we integrate our framework into production coding agents like VSCode Copilot, enabling developers to evolve agent skills via one line of vibe. Because our framework treats all agent components simply as standard editable code, this minimal pipeline naturally generalizes to full harness optimization (HarnessOpt). On SpreadsheetBench, HarnessOpt enables GPT-5.4-nano to achieve 0.7758 accuracy, outperforming the larger GPT-5.5 running standard pipelines (0.7620). Code is available at https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.