Protegendo o Agente de IA: Uma Estrutura Unificada para Red Teaming de Agentes em Múltiplas Camadas
Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
June 30, 2026
Autores: Yong Yang, Xing Zheng, Huiyu Wu, Huangsheng Cheng, Xiaorong Shi, Jing Guo, Bo Yang, Yi Zhou, Xiangfan Wu, Zonghao Ying
cs.AI
Resumo
O rápido crescimento da infraestrutura de IA de código aberto, desde motores de servição de modelos e plataformas de agentes até o ecossistema do Protocolo de Contexto de Modelo (MCP) e os próprios modelos de linguagem, superou as ferramentas de segurança disponíveis para defendê-la. Apresentamos o AI-Infra-Guard, uma estrutura de código aberto que organiza o red teaming de IA em torno de uma única observação: a superfície de ataque de um agente de IA é estratificada em camadas (infraestrutura, protocolo/ferramenta, comportamento do agente e modelo), e nenhum paradigma de detecção único se adequa a todas elas. A estrutura, portanto, associa um paradigma a cada camada, desde correspondência determinística de regras sobre mais de 75 componentes de IA e mais de 1.400 regras de vulnerabilidade, passando por auditoria agentiva orientada por LLM de servidores MCP e pacotes de habilidades de agentes e red teaming multi-turn de agentes em caixa preta, até um harness de jailbreak com mais de 26 operadores de ataque em dezesseis conjuntos de dados. Até onde sabemos, é a única estrutura de código aberto a abranger tudo isso, incluindo a auditoria da cadeia de suprimentos das habilidades dos agentes que cada vez mais estendem os agentes de IA. Lançamos o AI-Infra-Guard como código aberto para que a correspondência camada-paradigma possa servir como base prática para a segurança de agentes e como uma base compartilhada para a comunidade desenvolver.
English
The fast growth of open-source AI infrastructure, from model serving engines and agent platforms to the Model Context Protocol (MCP) ecosystem and the language models themselves, has outpaced the security tooling available to defend it. We present AI-Infra-Guard, an open-source framework that organizes AI red teaming around a single observation: the attack surface of an AI agent is stratified across layers (infrastructure, protocol/tool, agent behavior, and model), and no single detection paradigm fits all of them. The framework therefore matches a paradigm to each layer, from deterministic rule matching over 75+ AI components and 1{,}400+ vulnerability rules, through LLM-driven agentic auditing of MCP servers and agent-skill packages and multi-turn black-box agent red teaming, to a jailbreak harness with 26+ attack operators over sixteen datasets. To our knowledge it is the only open-source framework to span all of these, including supply-chain auditing of the agent skills that increasingly extend AI agents. We release AI-Infra-Guard as open source so that layer-paradigm matching can serve as a practical foundation for agent security and a shared base for the community to build on.