ChatPaper.aiChatPaper

Mastermind: Strategie-grondig Leren voor Kwetsbaarheidsreproductie op Repository-Schaal

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

July 2, 2026
Auteurs: Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng
cs.AI

Samenvatting

Reproductie van kwetsbaarheden op repository-niveau is een veeleisende software-engineeringtaak (SE): een agent moet een codebase inspecteren, de invoergrammatica afleiden die een kwetsbaar pad bereikt, een proof-of-concept (PoC) construeren en verifiëren dat de crash verdwijnt bij de gepatchte build. Recente LLM-agenten kunnen deze stappen vaak uitvoeren wanneer de aanpak correct is, maar falen nog steeds door de verkeerde strategie te kiezen. Dit artikel stelt dat strategie, in plaats van de volledige actietrajectorie, de juiste leereenheid is voor dergelijke SE-agenten: zij is compact genoeg om te optimaliseren, concreet genoeg om de uitvoering te sturen en stabiel genoeg om op te slaan en opnieuw te gebruiken bij pogingen. We presenteren Mastermind, een dubbel-lusraamwerk dat overdraagbaar strategieleren scheidt van taakspecifieke ervaring. Een trainbare planner leert herbruikbare kwetsbaarheidsreproductiestrategieën via SFT en mijlpaalgebaseerde GRPO, terwijl een ervaringslus taaklokale strategierecords bijhoudt die volgende pogingen sturen. De planner wordt onafhankelijk van de uitvoerder getraind, waardoor strategieleren meerdere bevroren uitvoerders kan verbeteren zonder hun actiegeneratievermogen te wijzigen. We evalueren Mastermind op CyberGym met 260 trainingstaken en 200 niet-geziene evaluatietaken. Met GPT-5.5 als bevroren uitvoerder bereikt Mastermind een slagingspercentage van 84,5%, beter dan open-boek PoC-context (60,0%), Best-of-8-sampling (63,0%) en iteratieve verbetering (77,0%). Dezelfde planner verbetert ook GPT-5.4 mini en GLM~5.1 van respectievelijk 45,0% en 58,5% naar 60,0% en 71,0%. Deze resultaten tonen aan dat het leren van strategieën op hoog niveau een effectief en overdraagbaar mechanisme is voor het verbeteren van SE-agenten op repository-schaal.
English
Repository-level vulnerability reproduction is a demanding software engineering (SE) task: an agent must inspect a codebase, infer the input grammar that reaches a vulnerable path, construct a proof-of-conceptv(PoC), and verify that the crash disappears on the patched build. Recent LLM agents can often execute these steps when the approach is correct, yet they still fail by choosing the wrong strategy. This paper argues that strategy, rather than the full action trajectory, is the right learning unit for such SE agents: it is compact enough to optimize, concrete enough to guide execution, and stable enough to store and reuse across attempts. We present Mastermind, a dual-loop framework that separates transferable strategy learning from task-specific experience. A trainable planner learns reusable vulnerability-reproduction strategies through SFT and milestone-based GRPO, while an experience loop maintains task-local strategy records that guide subsequent attempts. The planner is trained independently of the executor, allowing strategy learning to improve multiple frozen executors without modifying their action-generation capability. We evaluate Mastermind on CyberGym using 260 training tasks and 200 held-out evaluation tasks. With GPT-5.5 as the frozen executor, Mastermind achieves an 84.5% pass rate, outperforming open-book PoC context (60.0%), Best-of-8 sampling (63.0%), and iterative improvement (77.0%). The same planner also improves GPT-5.4 mini and GLM~5.1 from 45.0% and 58.5% to 60.0% and 71.0%. These results demonstrate that learning high-level strategies is an effective and transferable mechanism for improving repository-scale SE agents.