ToolHazard: LLMベースのエージェントのセキュリティ評価とアライメントのための敵対的環境のスケーリング
ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents
August 12, 2026
著者: Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye
cs.AI
要旨
外部ツールと統合された大規模言語モデル(LLM)エージェントは、環境状態に埋め込まれた間接的プロンプトインジェクションに対して脆弱である。しかし、既存研究の多くは、手動で実装または再利用された環境、確率的なLLMベースのツールシミュレーション、および事前定義されたインジェクション位置に依存しており、より広範な領域でのスケーラブルなセキュリティ研究を制限している。このギャップを埋めるため、我々は**ToolHazard**を提案する。これは、人間のエンジニアリングを削減し、追加のシードドメインと計算リソースによる拡張をサポートする、スケーラブルな敵対的環境合成フレームワークである。環境シミュレータ、攻撃エージェント、ユーザーシミュレータを通じて、ToolHazardは実行可能なステートフル環境を合成し、有効なインジェクション箇所を発見して環境固有のペイロードを生成し、状態に基づく長期的タスクを構築する。ToolHazardに基づき、我々は複雑なワークフローと多様な環境攻撃の下でエージェントをストレステストするための**ToolHazard-Bench**を構築する。実験により、エージェントの重大な脆弱性が明らかになり、インジェクションのタイミングと配置が攻撃の有効性に影響することが示された。さらに、ToolHazardが生成したアライメントデータは、良性タスクの有用性を維持しつつ、ToolHazard-BenchとAgentDojoの両方でセキュリティを向上させる。
English
Large language model (LLM) agents integrated with external tools are vulnerable to indirect prompt injections embedded in environmental states. However, existing studies largely rely on manually implemented or reused environments, stochastic LLM-based tool simulation, and predefined injection locations, limiting scalable security research across broader domains. To bridge this gap, we propose **ToolHazard**, a scalable adversarial environment synthesis framework that reduces human engineering and supports expansion with additional seed domains and compute. Through an Environment Simulator, an Attacker Agent, and a User Simulator, ToolHazard synthesizes executable stateful environments, discovers viable injection points and generates environment-specific payloads, and constructs state-grounded long-horizon tasks. Based on ToolHazard, we build **ToolHazard-Bench** for stress-testing agents under complex workflows and diverse environmental attacks. Experiments reveal substantial agent vulnerabilities and show that injection timing and placement affect attack effectiveness. Moreover, ToolHazard-generated alignment data improves security on both ToolHazard-Bench and AgentDojo while preserving benign task utility.