ChatPaper.aiChatPaper

ContinualSkillBench: LLMエージェントはその能力を真に進化させることができるのか?

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

August 4, 2026
著者: Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang
cs.AI

要旨

現代のエージェントフレームワークは、複雑なタスクを解決するために大規模言語モデルに外部スキルライブラリを装備させる。しかし、これらのシステムがスキルを効果的に進化させることができるのか、またその結果得られるスキルがタスク解決能力を向上させるのかは依然として不明である。このギャップを埋めるため、我々はインコンテキスト継続的スキル学習のための動的評価フレームワークであるContinualSkillBenchを導入する。これは5つの代表的なドメインを網羅し、各ドメインは難易度が増加する順に並べられた100の相互に接続されたサブタスクと、タスク横断的なスキル再利用の機会を含む。我々の実験は、逐次実行が一般的に性能を向上させるが、その向上幅はモデルとドメインによって大きく異なることを示している。さらに、インコンテキスト学習は平均的に明示的スキル維持と同等の性能を示し、改善の大部分が再利用可能なスキルの抽象化のみではなく、先行する文脈とフィードバックへの適応に由来することを示唆している。それにもかかわらず、明示的スキルは再利用可能な手順や正確な出力を必要とするタスクに対して選択的な利点をもたらす。さらに、性能の低いモデルは、より大規模で断片化されたタスク固有スキルのコレクションを蓄積する傾向があることを我々は見出した。これらの発見は、現在のインコンテキストスキル進化メカニズムが継続的適応を支援できる一方で、経験を堅牢で転移可能なスキルへと一貫して統合することには依然として課題があることを示している。
English
Modern agent frameworks equip large language models with external skill libraries to solve complex tasks. However, it remains unclear whether these systems can effectively evolve their skills and whether the resulting skills improve task-solving capabilities. To bridge this gap, we introduce ContinualSkillBench, a dynamic evaluation framework for in-context continual skill learning. It covers five representative domains, each containing 100 interconnected subtasks ordered by increasing difficulty and opportunities for cross-task skill reuse. Our experiments show that sequential execution generally improves performance, but the gains vary substantially across models and domains. Moreover, in-context learning performs comparably to explicit skill maintenance on average, suggesting that much of the improvement arises from adaptation to prior context and feedback rather than reusable skill abstraction alone. Explicit skills nevertheless provide selective benefits for tasks requiring reusable procedures or precise outputs. We further find that less capable models tend to accumulate larger, more fragmented collections of task-specific skills. These findings show that current in-context skill evolution mechanisms can support continual adaptation, but still struggle to consistently consolidate experience into robust and transferable skills.