Do Contexto às Habilidades: Os Modelos de Linguagem Podem Aprender Habilidades do Contexto de Forma Eficaz?
From Context to Skills: Can Language Models Learn from Context Skillfully?
May 3, 2026
Autores: Shuzheng Si, Haozhe Zhao, Yu Lei, Qingyi Wang, Dingwei Chen, Zhitong Wang, Zhenhailong Wang, Kangyang Luo, Zheng Wang, Gang Chen, Fanchao Qi, Minjia Zhang, Maosong Sun
cs.AI
Resumo
Muitas tarefas do mundo real exigem que modelos de linguagem (MLs) raciocinem sobre contextos complexos que excedem seu conhecimento paramétrico. Isso demanda aprendizado contextual, onde os MLs aprendem diretamente conhecimentos relevantes a partir do contexto fornecido. Uma solução intuitiva é a ampliação de habilidades no momento da inferência: extrair as regras e procedimentos do contexto para habilidades em linguagem natural. No entanto, a construção de tais habilidades para cenários de aprendizado contextual enfrenta dois desafios: o custo proibitivo da anotação manual de habilidades para contextos longos e tecnicamente densos, e a falta de feedback externo para a construção automatizada de habilidades. Neste artigo, propomos o Ctx2Skill, uma estrutura auto-evolutiva que descobre, refina e seleciona habilidades específicas do contexto de forma autônoma, sem supervisão humana ou feedback externo. Em seu núcleo, um loop de autojogo multiagente possui um Desafiador que gera tarefas de sondagem e rubricas, um Raciocinador que tenta resolvê-las guiado por um conjunto de habilidades em evolução, e um Juiz neutro que fornece feedback binário. Crucialmente, tanto o Desafiador quanto o Raciocinador evoluem através de habilidades acumuladas: agentes Proposto e Gerador dedicados analisam casos de falha e os sintetizam em atualizações de habilidades direcionadas para ambos os lados, permitindo a descoberta e o refinamento automatizado de habilidades. Para evitar o colapso adversarial causado pela geração de tarefas cada vez mais extremas e pelo acúmulo de habilidades superespecializadas, introduzimos ainda um mecanismo de Repetição Cruzada no Tempo que identifica o conjunto de habilidades que alcança o melhor equilíbrio entre casos representativos para o lado do Raciocinador, garantindo uma evolução de habilidades robusta e generalizável. As habilidades resultantes podem ser integradas a qualquer modelo de linguagem para obter uma melhor capacidade de aprendizado contextual. Avaliado em quatro tarefas de aprendizado contextual da CL-bench, o Ctx2Skill melhora consistentemente as taxas de resolução em diversos modelos de base.
English
Many real-world tasks require language models (LMs) to reason over complex contexts that exceed their parametric knowledge. This calls for context learning, where LMs directly learn relevant knowledge from the given context. An intuitive solution is inference-time skill augmentation: extracting the rules and procedures from context into natural-language skills. However, constructing such skills for context learning scenarios faces two challenges: the prohibitive cost of manual skill annotation for long, technically dense contexts, and the lack of external feedback for automated skill construction. In this paper, we propose Ctx2Skill, a self-evolving framework that autonomously discovers, refines, and selects context-specific skills without human supervision or external feedback. At its core, a multi-agent self-play loop has a Challenger that generates probing tasks and rubrics, a Reasoner that attempts to solve them guided by an evolving skill set, and a neutral Judge that provides binary feedback. Crucially, both the Challenger and the Reasoner evolve through accumulated skills: dedicated Proposer and Generator agents analyze failure cases and synthesize them into targeted skill updates for both sides, enabling automated skill discovery and refinement. To prevent adversarial collapse caused by increasingly extreme task generation and over-specialized skill accumulation, we further introduce a Cross-time Replay mechanism that identifies the skill set achieving the best balance across representative cases for the Reasoner side, ensuring robust and generalizable skill evolution. The resulting skills can be plugged into any language model to obtain better context learning capability. Evaluated on four context learning tasks from CL-bench, Ctx2Skill consistently improves solving rates across backbone models.