ChatPaper.aiChatPaper

Pruebas de seguridad de agentes de LLM a escala: del descubrimiento de riesgos a la verificación basada en evidencia

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

July 4, 2026
Autores: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng
cs.AI

Resumen

Los agentes de LLM realizan cada vez más acciones autónomas a través de herramientas externas, lo que genera riesgos de seguridad complejos y en evolución. Sin embargo, las pruebas de seguridad existentes se centran en violaciones de seguridad diseñadas por expertos, y los resultados correspondientes se evalúan mediante reglas codificadas de forma rígida, lo que dificulta su extensión a medida que los agentes evolucionan. Con este fin, presentamos Vera, un marco de pruebas de seguridad automatizado de extremo a extremo que aplica principios de ingeniería de software a agentes no deterministas mediante un pipeline auto-reforzante de tres etapas. Primero, una exploración basada en literatura descubre y estructura continuamente riesgos emergentes en taxonomías de riesgos de seguridad, métodos de ataque y entornos de ejecución de herramientas. Segundo, la composición combinatoria a través de las dimensiones de la taxonomía produce casos de seguridad ejecutables, cada uno especificando un objetivo de seguridad concreto, un estado inicial construido programáticamente y un predicado de verificación determinista fundamentado en artefactos observables. Tercero, la ejecución adaptativa ejecuta agentes heterogéneos en entornos aislados donde un agente de control dirige la interacción multiturno basándose en observaciones en tiempo de ejecución, mientras que verificadores basados en evidencia juzgan los resultados a partir del estado del entorno y las llamadas a herramientas, no de autoinformes del modelo. Evaluamos Vera en cuatro marcos de agentes de producción (OpenClaw, Hermes, Codex, Claude Code), revelando debilidades de seguridad significativas, con tasas de éxito de ataque promedio que alcanzan el 93.9% bajo ataques multicanal; también publicamos Vera-Bench, que comprende 1600 casos de seguridad ejecutables que abarcan 124 categorías de riesgo en tres entornos de ejecución. Estos resultados indican que una infraestructura de pruebas modular y ejecutable es esencial para una evaluación de seguridad rigurosa y mantenible de sistemas agentivos en rápida evolución a escala. El código está disponible públicamente en https://github.com/Yunhao-Feng/Vera.
English
LLM agents increasingly perform autonomous actions through external tools, leading to complex and evolving safety risks. However, existing safety testing targets expert-designed safety violations, and the corresponding outcomes are evaluated by hard-coded rules, making them costly to extend as agents evolve. To this end, we present Vera, an end-to-end automated safety testing framework that instantiates software engineering testing principles for non-deterministic agents through a three-stage, self-reinforcing pipeline. First, a literature-driven exploration continuously discovers and structures emerging risks into taxonomies of safety risks, attack methods, and tool execution environments. Second, combinatorial composition across taxonomy dimensions produces executable safety cases, each specifying a concrete safety goal, a programmatically constructed initial state, and a deterministic verification predicate grounded in observable artifacts. Third, adaptive execution runs heterogeneous agents in isolated sandboxes where a control agent steers multi-turn interaction based on runtime observations, while evidence-grounded verifiers judge outcomes from environment state and tool-call evidence rather than model self-report. We evaluate Vera on four production agent frameworks (OpenClaw, Hermes, Codex, Claude Code), revealing substantial safety weaknesses, with average attack success rates reaching 93.9\% under multi-channel attacks; we also release Vera-Bench, comprising 1600 executable safety cases spanning 124 risk categories across three execution settings. These results indicate that modular, executable testing infrastructure is essential for rigorous and maintainable safety evaluation of rapidly evolving agentic systems at scale. The code is publicly available at https://github.com/Yunhao-Feng/Vera.