Mastermind: стратегически обоснованное обучение для воспроизведения уязвимостей на уровне репозитория
Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
July 2, 2026
Авторы: Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng
cs.AI
Аннотация
Воспроизведение уязвимостей на уровне репозитория является сложной задачей программной инженерии (ПИ): агент должен изучить кодовую базу, вывести грамматику ввода, достигающую уязвимого пути, создать доказательство концепции (PoC) и убедиться, что сбой исчезает в исправленной сборке. Современные LLM-агенты часто могут выполнять эти шаги, когда подход верен, но всё же терпят неудачу из-за выбора неверной стратегии. В данной статье утверждается, что стратегия, а не полная траектория действий, является правильной единицей обучения для таких агентов ПИ: она достаточно компактна для оптимизации, достаточно конкретна для управления выполнением и достаточно стабильна для хранения и повторного использования в разных попытках. Мы представляем Mastermind — двухконтурную структуру, которая разделяет переносимое обучение стратегии и опыт, специфичный для задачи. Обучаемый планировщик изучает повторно используемые стратегии воспроизведения уязвимостей с помощью SFT и контрольной точки GRPO, в то время как контур опыта ведёт записи стратегий, специфичных для задачи, которые направляют последующие попытки. Планировщик обучается независимо от исполнителя, что позволяет обучению стратегии улучшать несколько замороженных исполнителей без изменения их способности генерировать действия. Мы оцениваем Mastermind на CyberGym, используя 260 обучающих задач и 200 задач для оценки, не использовавшихся в обучении. С GPT-5.5 в качестве замороженного исполнителя Mastermind достигает 84,5% успешных прохождений, превосходя контекст PoC в открытом режиме (60,0%), выборку Best-of-8 (63,0%) и итеративное улучшение (77,0%). Тот же планировщик также улучшает показатели GPT-5.4 mini и GLM~5.1 с 45,0% и 58,5% до 60,0% и 71,0%. Эти результаты показывают, что изучение высокоуровневых стратегий является эффективным и переносимым механизмом для улучшения агентов ПИ масштаба репозитория.
English
Repository-level vulnerability reproduction is a demanding software engineering (SE) task: an agent must inspect a codebase, infer the input grammar that reaches a vulnerable path, construct a proof-of-conceptv(PoC), and verify that the crash disappears on the patched build. Recent LLM agents can often execute these steps when the approach is correct, yet they still fail by choosing the wrong strategy. This paper argues that strategy, rather than the full action trajectory, is the right learning unit for such SE agents: it is compact enough to optimize, concrete enough to guide execution, and stable enough to store and reuse across attempts. We present Mastermind, a dual-loop framework that separates transferable strategy learning from task-specific experience. A trainable planner learns reusable vulnerability-reproduction strategies through SFT and milestone-based GRPO, while an experience loop maintains task-local strategy records that guide subsequent attempts. The planner is trained independently of the executor, allowing strategy learning to improve multiple frozen executors without modifying their action-generation capability. We evaluate Mastermind on CyberGym using 260 training tasks and 200 held-out evaluation tasks. With GPT-5.5 as the frozen executor, Mastermind achieves an 84.5% pass rate, outperforming open-book PoC context (60.0%), Best-of-8 sampling (63.0%), and iterative improvement (77.0%). The same planner also improves GPT-5.4 mini and GLM~5.1 from 45.0% and 58.5% to 60.0% and 71.0%. These results demonstrate that learning high-level strategies is an effective and transferable mechanism for improving repository-scale SE agents.