DecodingTrust-Agent Platform (DTap): Uma Plataforma de Red Teaming Controlável e Interativa para Agentes de IA
DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents
May 6, 2026
Autores: Zhaorun Chen, Xun Liu, Haibo Tong, Chengquan Guo, Yuzhou Nie, Jiawei Zhang, Mintong Kang, Chejian Xu, Qichang Liu, Xiaogeng Liu, Tianneng Shi, Chaowei Xiao, Sanmi Koyejo, Percy Liang, Wenbo Guo, Dawn Song, Bo Li
cs.AI
Resumo
Agentes de IA estão cada vez mais sendo implantados em diversos domínios para automatizar fluxos de trabalho complexos por meio de execuções de ações de longo horizonte e alto risco. Devido à sua alta capacidade e flexibilidade, tais agentes levantam preocupações significativas de segurança e proteção. Um número crescente de incidentes reais tem mostrado que adversários podem facilmente manipular agentes para realizar ações prejudiciais, como vazar chaves de API, excluir dados de usuários ou iniciar transações não autorizadas. Avaliar a segurança de agentes é intrinsecamente desafiador, pois os agentes operam em ambientes dinâmicos e não confiáveis, envolvendo ferramentas externas, fontes de dados heterogêneas e interações frequentes com usuários. No entanto, ambientes realistas, controláveis e reproduzíveis para avaliação de risco em larga escala permanecem amplamente inexplorados. Para preencher essa lacuna, apresentamos a Plataforma DecodingTrust-Agent (DTap), a primeira plataforma controlável e interativa de red-teaming para agentes de IA, abrangendo 14 domínios do mundo real e mais de 50 ambientes de simulação que replicam sistemas amplamente utilizados, como Google Workspace, PayPal e Slack. Para dimensionar a avaliação de risco de agentes na DTap, propomos ainda o DTap-Red, o primeiro agente autônomo de red-teaming que explora sistematicamente diversos vetores de injeção (por exemplo, prompt, ferramenta, habilidade, ambiente, combinações) e descobre de forma autônoma estratégias de ataque eficazes adaptadas a diferentes objetivos maliciosos. Usando o DTap-Red, curamos o DTap-Bench, um conjunto de dados de red-teaming em larga escala composto por instâncias de alta qualidade em vários domínios, cada uma acompanhada por um juiz verificável para validar automaticamente os resultados dos ataques. Por meio da DTap, realizamos avaliações em larga escala de agentes de IA populares construídos sobre diversos modelos base, abrangendo políticas de segurança, categorias de risco e estratégias de ataque, revelando padrões sistemáticos de vulnerabilidade e fornecendo insights valiosos para o desenvolvimento de agentes seguros de próxima geração.
English
AI agents are increasingly deployed across diverse domains to automate complex workflows through long-horizon and high-stakes action executions. Due to their high capability and flexibility, such agents raise significant security and safety concerns. A growing number of real-world incidents have shown that adversaries can easily manipulate agents into performing harmful actions, such as leaking API keys, deleting user data, or initiating unauthorized transactions. Evaluating agent security is inherently challenging, as agents operate in dynamic, untrusted environments involving external tools, heterogeneous data sources, and frequent user interactions. However, realistic, controllable, and reproducible environments for large-scale risk assessment remain largely underexplored. To address this gap, we introduce the DecodingTrust-Agent Platform (DTap), the first controllable and interactive red-teaming platform for AI agents, spanning 14 real-world domains and over 50 simulation environments that replicate widely used systems such as Google Workspace, Paypal, and Slack. To scale the risk assessment of agents in DTap, we further propose DTap-Red, the first autonomous red-teaming agent that systematically explores diverse injection vectors (e.g., prompt, tool, skill, environment, combinations) and autonomously discovers effective attack strategies tailored to varying malicious goals. Using DTap-Red, we curate DTap-Bench, a large-scale red-teaming dataset comprising high-quality instances across domains, each paired with a verifiable judge to automatically validate attack outcomes. Through DTap, we conduct large-scale evaluations of popular AI agents built on various backbone models, spanning security policies, risk categories, and attack strategies, revealing systematic vulnerability patterns and providing valuable insights for developing secure next-generation agents.