ChatPaper.aiChatPaper

SkillOpt-Lite: Melhor e Mais Rápida Autoevolução de Agentes através de uma Linha de Vibe

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

July 3, 2026
Autores: Yifei Shen, Bo Li, Xinjie Zhang
cs.AI

Resumo

Enquanto a otimização de habilidades para agentes autônomos tem ganhado tração, métodos existentes dependem de pipelines complexos. Isso deixa uma questão fundamental sem resposta: O que constitui um pipeline mínimo viável para otimização de habilidades, onde cada componente é justificado por teoria ou necessidade empírica? Formalizamos a otimização de habilidades via otimização de Ordem Zero (ZO), mapeando contrapartes clássicas (diferença central, regiões de confiança) para a literatura recente. Observando que, diferentemente das perturbações numéricas cegas na ZO clássica, trajetórias de habilidades servem como feedback de depuração interpretável. Fundamentados na filosofia Claude Code e na aprendizagem PAC, estabelecemos três princípios para convergência e generalização: exploração de trajetórias baseada em sistema de arquivos, mineração de atributos por consenso e controle de validação independente. Eliminando redundâncias, propomos SkillOpt-Lite. Ele acelera a convergência e supera o SkillOpt completo: melhorando o LiveMath em +8,8 pontos no GPT-5.5 e +25,4 pontos no GPT-5.4-nano, permitindo que o modelo nano supere o GPT-5.4 padrão otimizado pelo SkillOpt. Finalmente, integramos nossa estrutura em agentes de codificação de produção como o VSCode Copilot, permitindo que desenvolvedores evoluam habilidades do agente por meio de uma linha de vibração. Como nossa estrutura trata todos os componentes do agente simplesmente como código editável padrão, esse pipeline mínimo naturalmente generaliza para a otimização completa de harness (HarnessOpt). No SpreadsheetBench, o HarnessOpt permite que o GPT-5.4-nano alcance 0,7758 de acurácia, superando o GPT-5.5 maior executando pipelines padrão (0,7620). O código está disponível em https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.
English
While skill optimization for autonomous agents has gained traction, existing methods rely on complex pipelines. This leaves a fundamental question unaddressed: What constitutes a minimal viable pipeline for skill optimization, where every component is justified by theory or empirical necessity? We formalize skill optimization via Zeroth-Order (ZO) optimization, mapping classical counterparts (central difference, trust regions) to recent literature. Noting that unlike blind numerical perturbations in classical ZO, skill trajectories serve as interpretable debugging feedback. Grounded in Claude Code philosophy and PAC learning, we establish three principles for convergence and generalization: file-system-based trajectory exploration, consensus attribute mining, and independent validation gating. Eliminating redundancies, we propose SkillOpt-Lite. It accelerates convergence and outperforms full SkillOpt: improving LiveMath by +8.8 points on GPT-5.5 and +25.4 points on GPT-5.4-nano, allowing the nano model to surpass standard GPT-5.4 optimized by SkillOpt. Finally, we integrate our framework into production coding agents like VSCode Copilot, enabling developers to evolve agent skills via one line of vibe. Because our framework treats all agent components simply as standard editable code, this minimal pipeline naturally generalizes to full harness optimization (HarnessOpt). On SpreadsheetBench, HarnessOpt enables GPT-5.4-nano to achieve 0.7758 accuracy, outperforming the larger GPT-5.5 running standard pipelines (0.7620). Code is available at https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.