SKT: 검증된 합성 데이터 생성을 통한 대규모 스킬 활용 학습
SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
August 3, 2026
저자: Zelin Tan, Yiqun Zhang, Hao Li, Zhiyao Cui, Hejia Geng, Shao Zhang, Hangfan Zhang, Yang Chen, Xiaosong Wang, Lilong Wang, Zhenfei Yin, Shuyue Hu, Chen Zhang, Lei Bai
cs.AI
초록
에이전트 스킬은 언어 모델 에이전트에 재사용 가능한 절차적 지식을 부여하는 중요한 메커니즘으로 자리 잡았다. 그러나 스킬을 제공하는 것만으로는 현재 모델이 스킬을 효과적으로 식별하고 적용하며 조정할 수 있다고 보장되지 않는다. 본 연구는 스킬 사용 능력을 향상시키기 위해, 대규모 에이전트 스킬 컬렉션으로부터 스킬 기반 작업과 실행 가능한 궤적을 구축하는 검증된 데이터 합성 파이프라인인 SKT를 도입한다. SKT는 적합한 단일 스킬 및 다중 스킬 구성을 선택하고, 규칙 기반 및 에이전트 기반 검증과 피드백 기반 수정을 통해 작업을 합성하며, 필요한 모든 스킬을 실질적으로 사용한 성공적인 궤적만을 유지한다. SKT는 2,000개의 공개 스킬을 활용하여 4,000개의 작업 패키지와 27,164개의 검증된 궤적을 생성한다. 동일한 파이프라인과 분리된 테스트 풀을 기반으로, 우리는 스킬 사용을 평가하기 위한 별도의 실행 가능한 벤치마크인 SkillEval도 구축한다. 다양한 모델, 벤치마크, 에이전트 하니스에 걸친 실험 결과, SKT 생성 궤적에 대한 지도 미세 조정이 스킬 사용 성능을 일관되게 향상시키는 것으로 나타났다. 검증 제거 실험, 교차 하니스 평가, 확장 실험은 이러한 성과가 고품질 감독에 의존하며, 단일 에이전트 인터페이스를 넘어 확장되고, 더 넓은 스킬 커버리지에 따라 증가함을 추가로 입증한다. 종합하면, 이러한 결과는 검증된 데이터 합성이 스킬 사용 훈련을 위한 효과적이고 확장 가능한 접근 방식임을 보여준다.
English
Agent skills have become an important mechanism for equipping language-model agents with reusable procedural knowledge. However, providing skills alone does not guarantee that current models can effectively identify, apply, and coordinate them. To improve skill-use capabilities, we introduce SKT, a verified data synthesis pipeline that constructs skill-grounded tasks and executable trajectories from large collections of agent skills. SKT selects suitable single-skill and multi-skill configurations, synthesizes tasks through rule-based and agent-based verification with feedback-guided repair, and retains only successful trajectories that substantially use every required skill. Using 2,000 public skills, SKT produces 4,000 task packages and 27,164 verified trajectories. Based on the same pipeline and a disjoint test pool, we further construct SkillEval, a held-out executable benchmark for evaluating skill use. Experiments across diverse models, benchmarks, and agent harnesses show that supervised fine-tuning on SKT-generated trajectories consistently improves skill-use performance. Verification ablations, cross-harness evaluation, and scaling experiments further demonstrate that these gains depend on high-quality supervision, extend beyond a single agent interface, and increase with broader skill coverage. Together, these results establish verified data synthesis as an effective and scalable approach for skill-use training.