ChatPaper.aiChatPaper

От контролируемой среды к реальной: оценка агентов пентестинга для практического применения

From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World

July 14, 2026
Авторы: Pedro Conde, Henrique Branquinho, Valerio Mazzone, Bruno Mendes, André Baptista, Nuno Moniz
cs.AI

Аннотация

AI-агенты для пентестинга становятся всё более убедительными в качестве систем наступательной безопасности, однако текущие бенчмарки всё ещё дают ограниченное представление о том, какие из них покажут наилучшие результаты в реальных целях. Существующие протоколы оценки проверяют и оптимизируют выполнение заранее заданных целей, таких как захват флага (CTF), удаленное выполнение кода, воспроизведение эксплойта или сходство траекторий, в упрощенных или узких средах. Эти инструменты полезны для измерения ограниченных возможностей, но они не отражают в полной мере сложность, открытое исследование и стратегическое принятие решений, необходимые в реальном пентестинге. В данной статье мы представляем практический протокол оценки, который смещает акцент с выполнения задач на подтвержденное обнаружение уязвимостей, что позволяет проводить оценку на достаточно сложных целях, охватывающих множество поверхностей атак и классов уязвимостей. Протокол объединяет структурированные эталонные данные (ground truth) с семантическим сопоставлением на основе LLM для выявления уязвимостей, двудольное разрешение (bipartite resolution) для оценки результатов в условиях реалистичной неопределенности, непрерывное поддержание эталонных данных, повторную и накопительную оценку стохастических агентов, метрики эффективности и выбор сокращенного набора тестов для устойчивого экспериментирования. Данный протокол расширяет текущее состояние дел, обеспечивая более реалистичное и операционно значимое сравнение AI-агентов для пентестинга. Для обеспечения воспроизводимости мы также публикуем экспертно аннотированные эталонные данные и код для предложенного протокола оценки: https://github.com/ethiack/ethibench.
English
AI pentesting agents are increasingly credible as offensive security systems, but current benchmarks still provide limited guidance on which will perform best in real-world targets. Existing evaluation protocols assess and optimize for predefined goals such as capture-the-flag, remote code execution, exploit reproduction, or trajectory similarity, in simplified or narrow settings. These tools are valuable for measuring bounded capabilities, yet they do not adequately capture the complexity, open-ended exploration, and strategic decision-making required in realistic pentesting. In this paper, we present a practical evaluation protocol that shifts assessment from task completion to validated vulnerability discovery, allowing evaluation in sufficiently complex targets spanning multiple attack surfaces and vulnerability classes. The protocol combines structured ground-truth with LLM-based semantic matching to identify vulnerabilities, bipartite resolution to score findings under realistic ambiguity, continuous ground-truth maintenance, repeated and cumulative evaluation of stochastic agents, efficiency metrics, and reduced-suite selection for sustainable experimentation. This protocol extends the state of the art by enabling a more realistic, operationally informative comparison of AI pentesting agents. To enable reproducibility, we also release expert-annotated ground truth and code for the proposed evaluation protocol: https://github.com/ethiack/ethibench.