Veiligheidstesten van LLM-agenten op schaal: van risico-ontdekking naar op bewijs gefundeerde verificatie
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
July 4, 2026
Auteurs: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng
cs.AI
Samenvatting
LLM-agenten voeren steeds vaker autonome handelingen uit via externe tools, wat leidt tot complexe en evoluerende veiligheidsrisico's. Bestaande veiligheidstesten richten zich echter op door experts ontworpen veiligheidsschendingen, en de corresponderende uitkomsten worden beoordeeld door vastgelegde regels, waardoor ze kostbaar zijn om uit te breiden naarmate agenten evolueren. Daartoe presenteren we Vera, een end-to-end geautomatiseerd veiligheidstestframework dat principes van software-engineering testen voor niet-deterministische agenten implementeert via een driefasige, zelfversterkende pijplijn. Ten eerste ontdekt en structureert een literatuurgedreven verkenning continu opkomende risico's in taxonomieën van veiligheidsrisico's, aanvalsmethoden en tooluitvoeringsomgevingen. Ten tweede produceert combinatorische compositie over taxonomiedimensies uitvoerbare veiligheidscases, die elk een concreet veiligheidsdoel, een programmatisch geconstrueerde begintoestand en een deterministisch verificatiepredicaat dat is gebaseerd op waarneembare artefacten, specificeren. Ten derde voert adaptieve uitvoering heterogene agenten uit in geïsoleerde sandboxes, waar een controleagent de meerstapsinteractie stuurt op basis van runtime-observaties, terwijl op bewijs gebaseerde verifieerders uitkomsten beoordelen op basis van omgevingstoestand en toolaanroepbewijs in plaats van modelzelfrapportage. We evalueren Vera op vier productie-agentframeworks (OpenClaw, Hermes, Codex, Claude Code), wat aanzienlijke veiligheidszwaktes aan het licht brengt, met gemiddelde aanvalssuccespercentages van 93,9% bij meerkanaalsaanvallen; we geven ook Vera-Bench vrij, bestaande uit 1600 uitvoerbare veiligheidscases die 124 risicocategorieën bestrijken in drie uitvoeringsomgevingen. Deze resultaten geven aan dat modulaire, uitvoerbare testinfrastructuur essentieel is voor rigoureuze en onderhoudbare veiligheidsevaluatie van snel evoluerende agentische systemen op schaal. De code is openbaar beschikbaar op https://github.com/Yunhao-Feng/Vera.
English
LLM agents increasingly perform autonomous actions through external tools, leading to complex and evolving safety risks. However, existing safety testing targets expert-designed safety violations, and the corresponding outcomes are evaluated by hard-coded rules, making them costly to extend as agents evolve. To this end, we present Vera, an end-to-end automated safety testing framework that instantiates software engineering testing principles for non-deterministic agents through a three-stage, self-reinforcing pipeline. First, a literature-driven exploration continuously discovers and structures emerging risks into taxonomies of safety risks, attack methods, and tool execution environments. Second, combinatorial composition across taxonomy dimensions produces executable safety cases, each specifying a concrete safety goal, a programmatically constructed initial state, and a deterministic verification predicate grounded in observable artifacts. Third, adaptive execution runs heterogeneous agents in isolated sandboxes where a control agent steers multi-turn interaction based on runtime observations, while evidence-grounded verifiers judge outcomes from environment state and tool-call evidence rather than model self-report. We evaluate Vera on four production agent frameworks (OpenClaw, Hermes, Codex, Claude Code), revealing substantial safety weaknesses, with average attack success rates reaching 93.9\% under multi-channel attacks; we also release Vera-Bench, comprising 1600 executable safety cases spanning 124 risk categories across three execution settings. These results indicate that modular, executable testing infrastructure is essential for rigorous and maintainable safety evaluation of rapidly evolving agentic systems at scale. The code is publicly available at https://github.com/Yunhao-Feng/Vera.