ChatPaper.aiChatPaper

BraveGuard : des menaces en monde ouvert aux agents d'utilisation d'ordinateurs plus sûrs

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

June 2, 2026
Auteurs: Yunhao Feng, Xiaohu Du, Xinhao Deng, Yifan Ding, Ming Wen, Yixu Wang, Yuxiang Xie, Baihui Zheng, Yingshui Tan, Yige Li, Yutao Wu, Kerui Cao, Wenke Huang, Yanming Guo, Xingjun Ma, Yu-Gang Jiang
cs.AI

Résumé

Les agents d'utilisation d'ordinateur étendent les modèles de langage depuis la génération de texte jusqu'à une interaction soutenue avec des fichiers, des terminaux, des navigateurs et des outils externes. Cette transition crée des risques de sécurité difficiles à détecter à partir d'invites isolées ou de réponses finales, car les dommages n'émergent souvent qu'à travers des traces d'exécution multi-étapes dont les actions individuelles apparaissent localement bénignes. Nous introduisons BraveGuard, un cadre de défense auto-évolutif pour l'entraînement de modèles de garde à partir de signaux de menace issus du monde ouvert et de trajectoires réalistes d'agents. BraveGuard exploite des sources de recherche récentes pour identifier les risques émergents et les schémas d'attaque, les instancie sous forme de tâches d'utilisation d'ordinateur exécutables, collecte les déploiements d'agents et dérive une supervision au niveau des trajectoires pour l'entraînement des modèles de garde. À mesure que de nouvelles menaces et des échecs de validation apparaissent, le pipeline peut être répété, produisant une boucle de défense adaptative plutôt qu'un processus d'entraînement statique et piloté par des références. Nous instancions BraveGuard en entraînant plusieurs architectures de garde, y compris les variantes Qwen3-Guard et Llama-Guard, et évaluons les gardes résultantes sur des références de sécurité des agents au niveau des trajectoires. BraveGuard améliore systématiquement la détection de sécurité sur les trajectoires d'utilisation d'ordinateur. Sur AgentHazard, il améliore considérablement la précision de détection par rapport aux modèles de garde prêts à l'emploi, avec une précision passant de 38,79 % à 82,38 % dans le cadre du réglage moyen du modèle de garde. Ces résultats montrent qu'une supervision de garde ancrée dans la découverte de menaces en monde ouvert et l'exécution réaliste d'agents peut améliorer la surveillance de la sécurité au-delà des taxonomies fixes et des données synthétiques au niveau des invites. BraveGuard offre une voie évolutive vers des défenses adaptatives pour les agents d'utilisation d'ordinateur confrontés à des risques évolutifs dans le monde réel.
English
Computer-use agents extend language models from text generation to sustained interaction with files, terminals, browsers, and external tools. This shift creates safety risks that are difficult to detect from isolated prompts or final responses, because harm often emerges only through multi-step execution traces whose individual actions appear locally benign. We introduce BraveGuard, a self-evolving defense framework for training guard models from open-world threat signals and realistic agent trajectories. BraveGuard mines recent research sources to identify emerging risks and attack patterns, instantiates them as executable computer-use tasks, collects agent rollouts, and derives trajectory-level supervision for guard model training. As new threats and validation failures appear, the pipeline can be repeated, yielding an adaptive defense loop rather than a static, benchmark-driven training process. We instantiate BraveGuard by training multiple guard backbones, including Qwen3-Guard and Llama-Guard variants, and evaluate the resulting guards on trajectory-level agent-safety benchmarks. BraveGuard consistently improves safety detection across computer-use trajectories. On AgentHazard, it substantially improves detection accuracy over off-the-shelf guard models, with accuracy increasing from 38.79% to 82.38% under the averaged guard-model setting. These results show that guard supervision grounded in open-world threat discovery and realistic agent execution can improve safety monitoring beyond fixed taxonomies and synthetic prompt-level data. BraveGuard offers a scalable path toward adaptive defenses for computer-use agents facing evolving real-world risks.