Tests de sûreté des agents LLM à grande échelle : de la découverte des risques à la vérification fondée sur des preuves
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
July 4, 2026
Auteurs: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng
cs.AI
Résumé
Les agents LLM effectuent de plus en plus d'actions autonomes via des outils externes, ce qui engendre des risques de sécurité complexes et en constante évolution. Cependant, les tests de sécurité existants ciblent des violations de sécurité conçues par des experts, et les résultats correspondants sont évalués par des règles codées en dur, ce qui les rend coûteux à étendre à mesure que les agents évoluent. Pour répondre à ce problème, nous présentons Vera, un cadre de test de sécurité automatisé de bout en bout qui applique les principes de test du génie logiciel aux agents non déterministes à travers un pipeline auto-renforçant en trois étapes. Premièrement, une exploration guidée par la littérature découvre et structure en continu les risques émergents sous forme de taxonomies des risques de sécurité, des méthodes d'attaque et des environnements d'exécution des outils. Deuxièmement, une composition combinatoire entre les dimensions des taxonomies produit des cas de sécurité exécutables, chacun spécifiant un objectif de sécurité concret, un état initial construit par programmation et un prédicat de vérification déterministe ancré dans des artefacts observables. Troisièmement, une exécution adaptative fait fonctionner des agents hétérogènes dans des bacs à sable isolés, où un agent de contrôle oriente l'interaction multi-tour en fonction des observations à l'exécution, tandis que des vérificateurs fondés sur des preuves jugent les résultats à partir de l'état de l'environnement et des preuves issues des appels d'outils, plutôt que de l'auto-rapport du modèle. Nous évaluons Vera sur quatre frameworks d'agents de production (OpenClaw, Hermes, Codex, Claude Code), révélant d'importantes faiblesses de sécurité, avec des taux moyens de succès d'attaque atteignant 93,9 % dans le cadre d'attaques multicanal ; nous publions également Vera-Bench, qui comprend 1600 cas de sécurité exécutables couvrant 124 catégories de risque dans trois contextes d'exécution. Ces résultats indiquent qu'une infrastructure de test modulaire et exécutable est essentielle pour une évaluation de sécurité rigoureuse et maintenable des systèmes agentiques en évolution rapide, à grande échelle. Le code est disponible publiquement à l'adresse https://github.com/Yunhao-Feng/Vera.
English
LLM agents increasingly perform autonomous actions through external tools, leading to complex and evolving safety risks. However, existing safety testing targets expert-designed safety violations, and the corresponding outcomes are evaluated by hard-coded rules, making them costly to extend as agents evolve. To this end, we present Vera, an end-to-end automated safety testing framework that instantiates software engineering testing principles for non-deterministic agents through a three-stage, self-reinforcing pipeline. First, a literature-driven exploration continuously discovers and structures emerging risks into taxonomies of safety risks, attack methods, and tool execution environments. Second, combinatorial composition across taxonomy dimensions produces executable safety cases, each specifying a concrete safety goal, a programmatically constructed initial state, and a deterministic verification predicate grounded in observable artifacts. Third, adaptive execution runs heterogeneous agents in isolated sandboxes where a control agent steers multi-turn interaction based on runtime observations, while evidence-grounded verifiers judge outcomes from environment state and tool-call evidence rather than model self-report. We evaluate Vera on four production agent frameworks (OpenClaw, Hermes, Codex, Claude Code), revealing substantial safety weaknesses, with average attack success rates reaching 93.9\% under multi-channel attacks; we also release Vera-Bench, comprising 1600 executable safety cases spanning 124 risk categories across three execution settings. These results indicate that modular, executable testing infrastructure is essential for rigorous and maintainable safety evaluation of rapidly evolving agentic systems at scale. The code is publicly available at https://github.com/Yunhao-Feng/Vera.