ChatPaper.aiChatPaper

Mastermind: Aprendizado Fundamentado em Estratégia para Reprodução de Vulnerabilidades em Escala de Repositório

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

July 2, 2026
Autores: Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng
cs.AI

Resumo

A reprodução de vulnerabilidades em nível de repositório é uma tarefa exigente em engenharia de software (ES): um agente deve inspecionar uma base de código, inferir a gramática de entrada que alcança um caminho vulnerável, construir uma prova de conceito (PoC) e verificar que a falha desaparece na versão corrigida. Agentes baseados em LLM recentes frequentemente conseguem executar essas etapas quando a abordagem está correta, mas ainda falham ao escolher a estratégia errada. Este artigo argumenta que a estratégia, e não a trajetória completa de ações, é a unidade de aprendizado adequada para tais agentes de ES: ela é compacta o suficiente para ser otimizada, concreta o suficiente para guiar a execução e estável o suficiente para ser armazenada e reutilizada entre tentativas. Apresentamos o Mastermind, um framework de duplo loop que separa o aprendizado de estratégias transferíveis da experiência específica da tarefa. Um planejador treinável aprende estratégias reutilizáveis de reprodução de vulnerabilidades por meio de ajuste fino supervisionado (SFT) e otimização de política relativa ao grupo baseada em marcos (GRPO), enquanto um loop de experiência mantém registros de estratégia locais à tarefa que orientam tentativas subsequentes. O planejador é treinado independentemente do executor, permitindo que o aprendizado de estratégias melhore múltiplos executores congelados sem modificar sua capacidade de geração de ações. Avaliamos o Mastermind no CyberGym usando 260 tarefas de treinamento e 200 tarefas de avaliação retidas. Com o GPT-5.5 como executor congelado, o Mastermind atinge uma taxa de aprovação de 84,5%, superando o contexto de PoC com consulta aberta (60,0%), a amostragem de melhor entre 8 (63,0%) e a melhoria iterativa (77,0%). O mesmo planejador também melhora o GPT-5.4 mini e o GLM~5.1 de 45,0% e 58,5% para 60,0% e 71,0%. Esses resultados demonstram que aprender estratégias de alto nível é um mecanismo eficaz e transferível para melhorar agentes de ES em escala de repositório.
English
Repository-level vulnerability reproduction is a demanding software engineering (SE) task: an agent must inspect a codebase, infer the input grammar that reaches a vulnerable path, construct a proof-of-conceptv(PoC), and verify that the crash disappears on the patched build. Recent LLM agents can often execute these steps when the approach is correct, yet they still fail by choosing the wrong strategy. This paper argues that strategy, rather than the full action trajectory, is the right learning unit for such SE agents: it is compact enough to optimize, concrete enough to guide execution, and stable enough to store and reuse across attempts. We present Mastermind, a dual-loop framework that separates transferable strategy learning from task-specific experience. A trainable planner learns reusable vulnerability-reproduction strategies through SFT and milestone-based GRPO, while an experience loop maintains task-local strategy records that guide subsequent attempts. The planner is trained independently of the executor, allowing strategy learning to improve multiple frozen executors without modifying their action-generation capability. We evaluate Mastermind on CyberGym using 260 training tasks and 200 held-out evaluation tasks. With GPT-5.5 as the frozen executor, Mastermind achieves an 84.5% pass rate, outperforming open-book PoC context (60.0%), Best-of-8 sampling (63.0%), and iterative improvement (77.0%). The same planner also improves GPT-5.4 mini and GLM~5.1 from 45.0% and 58.5% to 60.0% and 71.0%. These results demonstrate that learning high-level strategies is an effective and transferable mechanism for improving repository-scale SE agents.