ChatPaper.aiChatPaper

SafeHarbor : garde-fou hiérarchique à mémoire augmentée pour la sécurité des agents LLM

SafeHarbor: Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

May 7, 2026
Auteurs: Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng
cs.AI

Résumé

Avec l'évolution rapide des modèles fondamentaux, les agents de type grand modèle de langage (LLM) ont démontré des capacités d'utilisation d'outils de plus en plus puissantes. Cependant, cette compétence introduit des risques de sécurité significatifs, car des acteurs malveillants peuvent manipuler les agents pour exécuter des outils générant du contenu nuisible. Bien que les mécanismes défensifs existants soient efficaces, ils souffrent fréquemment du problème de sur-refus, où un renforcement de la rigueur de sécurité compromet l'utilité de l'agent pour les tâches bénignes. Pour atténuer ce compromis, nous proposons SafeHarbor, un nouveau cadre conçu pour établir des limites de décision précises pour les agents LLM. Contrairement aux directives statiques, SafeHarbor extrait des règles de défense contextuelles via une génération adversarial renforcée. Nous concevons un système de mémoire hiérarchique locale pour l'injection dynamique de règles, offrant une solution sans apprentissage, efficace et prête à l'emploi. De plus, nous introduisons un mécanisme d'auto-évolution basé sur l'entropie de l'information qui optimise en continu la structure de la mémoire par division et fusion dynamiques de nœuds. Des expériences approfondies montrent que SafeHarbor atteint des performances de pointe à la fois sur des tâches bénignes ambiguës et des attaques malveillantes explicites, atteignant notamment un pic d'utilité bénigne de 63,6 % sur GPT-4o tout en maintenant un taux de refus robuste supérieur à 93 % face aux requêtes nuisibles. Le code source est accessible publiquement à l'adresse https://github.com/ljj-cyber/SafeHarbor.
English
With the rapid evolution of foundation models, Large Language Model (LLM) agents have demonstrated increasingly powerful tool-use capabilities. However, this proficiency introduces significant security risks, as malicious actors can manipulate agents into executing tools to generate harmful content. While existing defensive mechanisms are effective, they frequently suffer from the over-refusal problem, where increased safety strictness compromises the agent's utility on benign tasks. To mitigate this trade-off, we propose SafeHarbor, a novel framework designed to establish precise decision boundaries for LLM agents. Unlike static guidelines, SafeHarbor extracts context-aware defense rules through enhanced adversarial generation. We design a local hierarchical memory system for dynamic rule injection, offering a training-free, efficient, and plug-and-play solution. Furthermore, we introduce an information entropy-based self-evolution mechanism that continuously optimizes the memory structure through dynamic node splitting and merging. Extensive experiments demonstrate that SafeHarbor achieves state-of-the-art performance on both ambiguous benign tasks and explicit malicious attacks, notably attaining a peak benign utility of 63.6\% on GPT-4o while maintaining a robust refusal rate exceeding 93\% against harmful requests. The source code is publicly available at https://github.com/ljj-cyber/SafeHarbor.