ChatPaper.aiChatPaper

Du contrôlé au sauvage : évaluation des agents de pentesting pour le monde réel

From Controlled to the Wild: Evaluation of Pentesting Agents for the Real-World

July 14, 2026
Auteurs: Pedro Conde, Henrique Branquinho, Valerio Mazzone, Bruno Mendes, André Baptista, Nuno Moniz
cs.AI

Résumé

Les agents de test d’intrusion basés sur l’IA gagnent en crédibilité en tant que systèmes de sécurité offensifs, mais les benchmarks actuels n’offrent qu’un aperçu limité des performances dans des cibles réelles. Les protocoles d’évaluation existants mesurent et optimisent des objectifs prédéfinis tels que le capture-the-flag, l’exécution de code à distance, la reproduction d’exploit ou la similarité de trajectoire, dans des environnements simplifiés ou restreints. Ces outils sont utiles pour évaluer des capacités bornées, mais ils ne capturent pas correctement la complexité, l’exploration ouverte et la prise de décision stratégique requises dans un test d’intrusion réaliste. Dans cet article, nous présentons un protocole d’évaluation pratique qui déplace l’évaluation de la simple réalisation de tâches vers la découverte validée de vulnérabilités, permettant ainsi une évaluation sur des cibles suffisamment complexes couvrant plusieurs surfaces d’attaque et classes de vulnérabilités. Le protocole combine une vérité terrain structurée avec un appariement sémantique basé sur LLM pour identifier les vulnérabilités, une résolution bipartite pour noter les résultats sous une ambiguïté réaliste, une maintenance continue de la vérité terrain, une évaluation répétée et cumulative des agents stochastiques, des métriques d’efficacité, et une sélection de suite réduite pour une expérimentation durable. Ce protocole repousse l’état de l’art en permettant une comparaison plus réaliste et opérationnellement informative des agents de test d’intrusion IA. Pour garantir la reproductibilité, nous publions également la vérité terrain annotée par des experts et le code du protocole d’évaluation proposé : https://github.com/ethiack/ethibench.
English
AI pentesting agents are increasingly credible as offensive security systems, but current benchmarks still provide limited guidance on which will perform best in real-world targets. Existing evaluation protocols assess and optimize for predefined goals such as capture-the-flag, remote code execution, exploit reproduction, or trajectory similarity, in simplified or narrow settings. These tools are valuable for measuring bounded capabilities, yet they do not adequately capture the complexity, open-ended exploration, and strategic decision-making required in realistic pentesting. In this paper, we present a practical evaluation protocol that shifts assessment from task completion to validated vulnerability discovery, allowing evaluation in sufficiently complex targets spanning multiple attack surfaces and vulnerability classes. The protocol combines structured ground-truth with LLM-based semantic matching to identify vulnerabilities, bipartite resolution to score findings under realistic ambiguity, continuous ground-truth maintenance, repeated and cumulative evaluation of stochastic agents, efficiency metrics, and reduced-suite selection for sustainable experimentation. This protocol extends the state of the art by enabling a more realistic, operationally informative comparison of AI pentesting agents. To enable reproducibility, we also release expert-annotated ground truth and code for the proposed evaluation protocol: https://github.com/ethiack/ethibench.