ChatPaper.aiChatPaper

Тестирование безопасности LLM-агентов в масштабе: от обнаружения рисков к доказательной верификации

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

July 4, 2026
Авторы: Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng
cs.AI

Аннотация

Агенты на основе больших языковых моделей всё чаще выполняют автономные действия через внешние инструменты, что порождает сложные и эволюционирующие риски для безопасности. Однако существующее тестирование безопасности ориентировано на нарушения, разработанные экспертами, а соответствующие результаты оцениваются по жёстко заданным правилам, что делает их дорогостоящими в расширении по мере развития агентов. Для решения этой проблемы мы представляем Vera — сквозную автоматизированную платформу тестирования безопасности, которая реализует принципы тестирования программного обеспечения для недетерминированных агентов с помощью трёхэтапного самоподкрепляющегося конвейера. Во-первых, управляемый литературой анализ непрерывно выявляет и структурирует возникающие риски в таксономии рисков безопасности, методов атак и сред выполнения инструментов. Во-вторых, комбинаторное составление по измерениям таксономии создаёт исполняемые сценарии безопасности, каждый из которых задаёт конкретную цель безопасности, программно сконструированное начальное состояние и детерминированный предикат верификации, основанный на наблюдаемых артефактах. В-третьих, адаптивное выполнение запускает гетерогенных агентов в изолированных песочницах, где управляющий агент направляет многошаговое взаимодействие на основе наблюдений времени выполнения, а проверяющие модули, основанные на фактических данных, оценивают результаты по состоянию среды и свидетельствам вызовов инструментов, а не по самоотчётам модели. Мы оцениваем Vera на четырёх производственных фреймворках агентов (OpenClaw, Hermes, Codex, Claude Code), выявляя существенные недостатки в безопасности: средний показатель успешности атак достигает 93,9% при многоканальных атаках. Мы также публикуем Vera-Bench, содержащий 1600 исполняемых сценариев безопасности, охватывающих 124 категории рисков в трёх средах выполнения. Эти результаты показывают, что модульная, исполняемая инфраструктура тестирования необходима для строгой и поддерживаемой оценки безопасности быстро развивающихся агентных систем в масштабе. Код доступен по адресу https://github.com/Yunhao-Feng/Vera.
English
LLM agents increasingly perform autonomous actions through external tools, leading to complex and evolving safety risks. However, existing safety testing targets expert-designed safety violations, and the corresponding outcomes are evaluated by hard-coded rules, making them costly to extend as agents evolve. To this end, we present Vera, an end-to-end automated safety testing framework that instantiates software engineering testing principles for non-deterministic agents through a three-stage, self-reinforcing pipeline. First, a literature-driven exploration continuously discovers and structures emerging risks into taxonomies of safety risks, attack methods, and tool execution environments. Second, combinatorial composition across taxonomy dimensions produces executable safety cases, each specifying a concrete safety goal, a programmatically constructed initial state, and a deterministic verification predicate grounded in observable artifacts. Third, adaptive execution runs heterogeneous agents in isolated sandboxes where a control agent steers multi-turn interaction based on runtime observations, while evidence-grounded verifiers judge outcomes from environment state and tool-call evidence rather than model self-report. We evaluate Vera on four production agent frameworks (OpenClaw, Hermes, Codex, Claude Code), revealing substantial safety weaknesses, with average attack success rates reaching 93.9\% under multi-channel attacks; we also release Vera-Bench, comprising 1600 executable safety cases spanning 124 risk categories across three execution settings. These results indicate that modular, executable testing infrastructure is essential for rigorous and maintainable safety evaluation of rapidly evolving agentic systems at scale. The code is publicly available at https://github.com/Yunhao-Feng/Vera.