Teste de Segurança de Agentes de LLM em Escala: Da Descoberta de Riscos à Verificação Baseada em Evidências
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
July 4, 2026
Autores: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng
cs.AI
Resumo
Os agentes de LLM realizam cada vez mais ações autônomas por meio de ferramentas externas, gerando riscos de segurança complexos e em evolução. No entanto, os testes de segurança existentes têm como alvo violações de segurança projetadas por especialistas, e os resultados correspondentes são avaliados por regras codificadas de forma fixa, tornando sua extensão custosa à medida que os agentes evoluem. Para isso, apresentamos Vera, um framework automatizado de teste de segurança de ponta a ponta que instancia princípios de teste de engenharia de software para agentes não determinísticos por meio de um pipeline auto-reforçador de três estágios. Primeiro, uma exploração orientada pela literatura descobre e estrutura continuamente riscos emergentes em taxonomias de riscos de segurança, métodos de ataque e ambientes de execução de ferramentas. Segundo, a composição combinatória entre as dimensões da taxonomia produz casos de segurança executáveis, cada um especificando uma meta concreta de segurança, um estado inicial construído programaticamente e um predicado de verificação determinístico fundamentado em artefatos observáveis. Terceiro, a execução adaptativa opera agentes heterogêneos em sandboxes isolados, onde um agente de controle direciona a interação de múltiplas rodadas com base em observações em tempo de execução, enquanto verificadores fundamentados em evidências julgam os resultados a partir do estado do ambiente e de evidências de chamadas a ferramentas, em vez de autorrelato do modelo. Avaliamos Vera em quatro frameworks de agentes em produção (OpenClaw, Hermes, Codex, Claude Code), revelando fragilidades substanciais de segurança, com taxas médias de sucesso de ataque atingindo 93,9% sob ataques multicanais; também lançamos o Vera-Bench, que compreende 1600 casos de segurança executáveis abrangendo 124 categorias de risco em três configurações de execução. Esses resultados indicam que uma infraestrutura modular e executável de testes é essencial para uma avaliação de segurança rigorosa e sustentável de sistemas agentes em rápida evolução, em escala. O código está disponível publicamente em https://github.com/Yunhao-Feng/Vera.
English
LLM agents increasingly perform autonomous actions through external tools, leading to complex and evolving safety risks. However, existing safety testing targets expert-designed safety violations, and the corresponding outcomes are evaluated by hard-coded rules, making them costly to extend as agents evolve. To this end, we present Vera, an end-to-end automated safety testing framework that instantiates software engineering testing principles for non-deterministic agents through a three-stage, self-reinforcing pipeline. First, a literature-driven exploration continuously discovers and structures emerging risks into taxonomies of safety risks, attack methods, and tool execution environments. Second, combinatorial composition across taxonomy dimensions produces executable safety cases, each specifying a concrete safety goal, a programmatically constructed initial state, and a deterministic verification predicate grounded in observable artifacts. Third, adaptive execution runs heterogeneous agents in isolated sandboxes where a control agent steers multi-turn interaction based on runtime observations, while evidence-grounded verifiers judge outcomes from environment state and tool-call evidence rather than model self-report. We evaluate Vera on four production agent frameworks (OpenClaw, Hermes, Codex, Claude Code), revealing substantial safety weaknesses, with average attack success rates reaching 93.9\% under multi-channel attacks; we also release Vera-Bench, comprising 1600 executable safety cases spanning 124 risk categories across three execution settings. These results indicate that modular, executable testing infrastructure is essential for rigorous and maintainable safety evaluation of rapidly evolving agentic systems at scale. The code is publicly available at https://github.com/Yunhao-Feng/Vera.