Do Texto de Habilidade à Estrutura de Habilidade: A Representação Agendamento-Estrutura-Lógica para Habilidades de Agentes
From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills
April 27, 2026
Autores: Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu
cs.AI
Resumo
Os agentes de LLM dependem cada vez mais de habilidades reutilizáveis, pacotes de capacidades que combinam instruções, fluxo de controle, restrições e chamadas de ferramentas. Na maioria dos sistemas de agentes atuais, no entanto, as habilidades ainda são representadas por artefatos excessivamente textuais, incluindo documentos no estilo SKILL.md e registros estruturados cuja evidência utilizável por máquinas permanece embutida principalmente em descrições em linguagem natural. Isso representa um desafio para sistemas de agentes centrados em habilidades: gerenciar coleções de habilidades e usar habilidades para apoiar agentes exigem raciocínio sobre interfaces de invocação, estrutura de execução e efeitos colaterais concretos que frequentemente estão entrelaçados em uma única superfície textual. Uma representação explícita do conhecimento de habilidades pode, portanto, ajudar a tornar esses artefatos mais fáceis de serem adquiridos e aproveitados pelas máquinas. Baseando-nos nos Pacotes de Organização de Memória (MOPs), na Teoria de Scripts e na Dependência Conceitual do trabalho clássico de Schank e Abelson sobre representação do conhecimento linguístico, introduzimos o que é, até onde sabemos, a primeira representação estruturada para artefatos de habilidades de agente que desembaraça sinais de agendamento em nível de habilidade, estrutura de execução em nível de cena e evidência de ação e uso de recursos em nível lógico: a representação Agendamento-Estrutural-Lógica (SSL). Instanciamos a SSL com um normalizador baseado em LLM e a avaliamos em um corpus de habilidades em duas tarefas, Descoberta de Habilidades e Avaliação de Riscos, superando significativamente as baselines baseadas apenas em texto: na Descoberta de Habilidades, a SSL melhora o MRR de 0,573 para 0,707; na Avaliação de Riscos, melhora o F1 macro de 0,744 para 0,787. Esses achados revelam que uma estrutura explícita e fundamentada na fonte torna as habilidades dos agentes mais fáceis de pesquisar e revisar. Eles também sugerem que a SSL é melhor compreendida como um passo prático em direção a representações de habilidades mais inspecionáveis, reutilizáveis e operacionalmente acionáveis para sistemas de agentes, em vez de um padrão finalizado ou um mecanismo de ponta a ponta para gerenciar e usar habilidades.
English
LLM agents increasingly rely on reusable skills, capability packages that combine instructions, control flow, constraints, and tool calls. In most current agent systems, however, skills are still represented by text-heavy artifacts, including SKILL.md-style documents and structured records whose machine-usable evidence remains embedded largely in natural-language descriptions. This poses a challenge for skill-centered agent systems: managing skill collections and using skills to support agent both require reasoning over invocation interfaces, execution structure, and concrete side effects that are often entangled in a single textual surface. An explicit representation of skill knowledge may therefore help make these artifacts easier for machines to acquire and leverage. Drawing on Memory Organization Packets, Script Theory, and Conceptual Dependency from Schank and Abelson's classical work on linguistic knowledge representation, we introduce what is, to our knowledge, the first structured representation for agent skill artifacts that disentangles skill-level scheduling signals, scene-level execution structure, and logic-level action and resource-use evidence: the Scheduling-Structural-Logical (SSL) representation. We instantiate SSL with an LLM-based normalizer and evaluate it on a corpus of skills in two tasks, Skill Discovery and Risk Assessment, and superiorly outperform the text-only baselines: in Skill Discovery, SSL improves MRR from 0.573 to 0.707; in Risk Assessment, it improves macro F1 from 0.744 to 0.787. These findings reveal that explicit, source-grounded structure makes agent skills easier to search and review. They also suggest that SSL is best understood as a practical step toward more inspectable, reusable, and operationally actionable skill representations for agent systems, rather than as a finished standard or an end-to-end mechanism for managing and using skills.