ChatPaper.aiChatPaper

Mastermind: Aprendizaje fundamentado en estrategias para la reproducción de vulnerabilidades a escala de repositorio

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

July 2, 2026
Autores: Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng
cs.AI

Resumen

La reproducción de vulnerabilidades a nivel de repositorio es una tarea exigente en ingeniería de software (IS): un agente debe inspeccionar un código base, inferir la gramática de entrada que alcanza una ruta vulnerable, construir una prueba de concepto (PoC) y verificar que el fallo desaparezca en la versión corregida. Los agentes LLM recientes a menudo pueden ejecutar estos pasos cuando el enfoque es correcto, pero aún fallan al elegir la estrategia equivocada. Este artículo argumenta que la estrategia, más que la trayectoria completa de acciones, es la unidad de aprendizaje adecuada para tales agentes de IS: es lo suficientemente compacta para optimizar, lo suficientemente concreta para guiar la ejecución y lo suficientemente estable para almacenar y reutilizar entre intentos. Presentamos Mastermind, un marco de doble bucle que separa el aprendizaje transferible de estrategias de la experiencia específica de la tarea. Un planificador entrenable aprende estrategias reutilizables de reproducción de vulnerabilidades mediante SFT y GRPO basado en hitos, mientras que un bucle de experiencia mantiene registros de estrategias locales a la tarea que guían intentos posteriores. El planificador se entrena de forma independiente del ejecutor, lo que permite que el aprendizaje de estrategias mejore múltiples ejecutores congelados sin modificar su capacidad de generación de acciones. Evaluamos Mastermind en CyberGym utilizando 260 tareas de entrenamiento y 200 tareas de evaluación reservadas. Con GPT-5.5 como ejecutor congelado, Mastermind alcanza una tasa de éxito del 84.5%, superando al contexto de PoC a libro abierto (60.0%), al muestreo Best-of-8 (63.0%) y a la mejora iterativa (77.0%). El mismo planificador también mejora GPT-5.4 mini y GLM~5.1 del 45.0% y 58.5% al 60.0% y 71.0%. Estos resultados demuestran que aprender estrategias de alto nivel es un mecanismo efectivo y transferible para mejorar agentes de IS a escala de repositorio.
English
Repository-level vulnerability reproduction is a demanding software engineering (SE) task: an agent must inspect a codebase, infer the input grammar that reaches a vulnerable path, construct a proof-of-conceptv(PoC), and verify that the crash disappears on the patched build. Recent LLM agents can often execute these steps when the approach is correct, yet they still fail by choosing the wrong strategy. This paper argues that strategy, rather than the full action trajectory, is the right learning unit for such SE agents: it is compact enough to optimize, concrete enough to guide execution, and stable enough to store and reuse across attempts. We present Mastermind, a dual-loop framework that separates transferable strategy learning from task-specific experience. A trainable planner learns reusable vulnerability-reproduction strategies through SFT and milestone-based GRPO, while an experience loop maintains task-local strategy records that guide subsequent attempts. The planner is trained independently of the executor, allowing strategy learning to improve multiple frozen executors without modifying their action-generation capability. We evaluate Mastermind on CyberGym using 260 training tasks and 200 held-out evaluation tasks. With GPT-5.5 as the frozen executor, Mastermind achieves an 84.5% pass rate, outperforming open-book PoC context (60.0%), Best-of-8 sampling (63.0%), and iterative improvement (77.0%). The same planner also improves GPT-5.4 mini and GLM~5.1 from 45.0% and 58.5% to 60.0% and 71.0%. These results demonstrate that learning high-level strategies is an effective and transferable mechanism for improving repository-scale SE agents.