Mastermind : apprentissage fondé sur la stratégie pour la reproduction de vulnérabilités à l'échelle du dépôt
Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
July 2, 2026
Auteurs: Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng
cs.AI
Résumé
La reproduction de vulnérabilités au niveau du dépôt est une tâche exigeante en génie logiciel (GL) : un agent doit inspecter une base de code, inférer la grammaire d’entrée qui atteint un chemin vulnérable, construire une preuve de concept (PoC), et vérifier que le crash disparaît sur la version corrigée. Les agents LLM récents parviennent souvent à exécuter ces étapes lorsque l’approche est correcte, mais ils échouent encore en choisissant la mauvaise stratégie. Cet article soutient que la stratégie, plutôt que la trajectoire d’actions complète, constitue l’unité d’apprentissage appropriée pour ces agents GL : elle est suffisamment compacte pour être optimisée, suffisamment concrète pour guider l’exécution, et suffisamment stable pour être stockée et réutilisée entre les tentatives. Nous présentons Mastermind, un cadre à double boucle qui sépare l’apprentissage de stratégies transférables de l’expérience spécifique à la tâche. Un planificateur entraînable apprend des stratégies réutilisables de reproduction de vulnérabilités via du fine-tuning supervisé (SFT) et un GRPO basé sur des jalons, tandis qu’une boucle d’expérience maintient des enregistrements de stratégies propres à la tâche qui guident les tentatives suivantes. Le planificateur est entraîné indépendamment de l’exécuteur, ce qui permet à l’apprentissage de stratégies d’améliorer plusieurs exécuteurs figés sans modifier leur capacité de génération d’actions. Nous évaluons Mastermind sur CyberGym en utilisant 260 tâches d’entraînement et 200 tâches d’évaluation réservées. Avec GPT-5.5 comme exécuteur figé, Mastermind atteint un taux de réussite de 84,5 %, surpassant le contexte de PoC à livre ouvert (60,0 %), l’échantillonnage Best-of-8 (63,0 %) et l’amélioration itérative (77,0 %). Le même planificateur améliore également GPT-5.4 mini et GLM~5.1, passant de 45,0 % et 58,5 % à 60,0 % et 71,0 %. Ces résultats démontrent que l’apprentissage de stratégies de haut niveau est un mécanisme efficace et transférable pour améliorer les agents GL à l’échelle du dépôt.
English
Repository-level vulnerability reproduction is a demanding software engineering (SE) task: an agent must inspect a codebase, infer the input grammar that reaches a vulnerable path, construct a proof-of-conceptv(PoC), and verify that the crash disappears on the patched build. Recent LLM agents can often execute these steps when the approach is correct, yet they still fail by choosing the wrong strategy. This paper argues that strategy, rather than the full action trajectory, is the right learning unit for such SE agents: it is compact enough to optimize, concrete enough to guide execution, and stable enough to store and reuse across attempts. We present Mastermind, a dual-loop framework that separates transferable strategy learning from task-specific experience. A trainable planner learns reusable vulnerability-reproduction strategies through SFT and milestone-based GRPO, while an experience loop maintains task-local strategy records that guide subsequent attempts. The planner is trained independently of the executor, allowing strategy learning to improve multiple frozen executors without modifying their action-generation capability. We evaluate Mastermind on CyberGym using 260 training tasks and 200 held-out evaluation tasks. With GPT-5.5 as the frozen executor, Mastermind achieves an 84.5% pass rate, outperforming open-book PoC context (60.0%), Best-of-8 sampling (63.0%), and iterative improvement (77.0%). The same planner also improves GPT-5.4 mini and GLM~5.1 from 45.0% and 58.5% to 60.0% and 71.0%. These results demonstrate that learning high-level strategies is an effective and transferable mechanism for improving repository-scale SE agents.