Spécifications des Kits d'Agents : Flux de Travail Agentiels Fondés sur le Contexte
Spec Kit Agents: Context-Grounded Agentic Workflows
April 7, 2026
Auteurs: Pardis Taghavi, Santosh Bhavani
cs.AI
Résumé
Le développement piloté par les spécifications (SDD) avec des agents de codage IA offre un flux de travail structuré, mais les agents restent souvent « aveugles au contexte » dans les grands dépôts en évolution, ce qui entraîne des hallucinations d'API et des violations architecturales. Nous présentons Spec Kit Agents, un pipeline SDD multi-agents (avec des rôles de chef de projet et de développeur) qui intègre des hooks d'ancrage contextuel par phase. Les hooks de lecture seule ancrent chaque étape (Spécifier, Planifier, Tâches, Implémenter) dans les preuves du dépôt, tandis que les hooks de validation vérifient les artefacts intermédiaires par rapport à l'environnement. Nous évaluons 128 exécutions couvrant 32 fonctionnalités sur cinq dépôts. Les hooks d'ancrage contextuel améliorent la qualité jugée de +0,15 sur un score composite de 1 à 5 évalué par un LLM-juge (+3,0 pour cent du score total ; test des rangs signés de Wilcoxon, p < 0,05) tout en maintenant une compatibilité des tests au niveau du dépôt de 99,7 à 100 pour cent. Nous évaluons en outre le framework sur SWE-bench Lite, où les hooks d'augmentation améliorent la ligne de base de 1,7 pour cent, atteignant 58,2 pour cent de Pass@1.
English
Spec-driven development (SDD) with AI coding agents provides a structured workflow, but agents often remain "context blind" in large, evolving repositories, leading to hallucinated APIs and architectural violations. We present Spec Kit Agents, a multi-agent SDD pipeline (with PM and developer roles) that adds phase-level, context-grounding hooks. Read-only probing hooks ground each stage (Specify, Plan, Tasks, Implement) in repository evidence, while validation hooks check intermediate artifacts against the environment. We evaluate 128 runs covering 32 features across five repositories. Context-grounding hooks improve judged quality by +0.15 on a 1-5 composite LLM-as-judge score (+3.0 percent of the full score; Wilcoxon signed-rank, p < 0.05) while maintaining 99.7-100 percent repository-level test compatibility. We further evaluate the framework on SWE-bench Lite, where augmentation hooks improve baseline by 1.7 percent, achieving 58.2 percent Pass@1.