ChatPaper.aiChatPaper

FORTIS : Évaluation comparative du sur-privilège dans les compétences des agents

FORTIS: Benchmarking Over-Privilege in Agent Skills

May 9, 2026
Auteurs: Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhang, Yue Zhao
cs.AI

Résumé

Les agents basés sur de grands modèles de langage opèrent de plus en plus via une couche de compétences intermédiaire qui fait le lien entre l'intention de l'utilisateur et l'exécution concrète des tâches. Cette couche est largement traitée comme une abstraction organisationnelle, mais nous soutenons qu'elle constitue également une frontière de privilège que les modèles actuels franchissent systématiquement de manière excessive. Nous présentons FORTIS, un banc d'essai qui évalue le sur-privilège dans les compétences des agents en deux étapes : d'une part, si le modèle sélectionne la compétence minimalement suffisante parmi une vaste bibliothèque de compétences se chevauchant, et d'autre part, s'il exécute cette compétence sans étendre son action à des outils ou des actions plus larges que ceux permis par la compétence. À travers dix modèles de pointe et trois domaines, nous constatons que le comportement sur-privilégié est la norme plutôt que l'exception. Les modèles cherchent systématiquement à utiliser des compétences et des outils dotés de privilèges plus élevés que ce que la tâche requiert, échouant dans les deux étapes à des taux qui restent élevés, même pour les modèles les plus performants disponibles. L'échec est particulièrement grave dans les conditions ordinaires d'interaction réelle avec l'utilisateur : spécification incomplète, cadrage de commodité et proximité des limites de compétence. Aucune de ces conditions ne nécessite une construction antagoniste. Les résultats indiquent que la couche de compétences, loin de contenir le comportement de l'agent, constitue elle-même une source principale d'escalade de privilèges dans les systèmes actuels.
English
Large language model agents increasingly operate through an intermediate skill layer that mediates between user intent and concrete task execution. This layer is widely treated as an organizational abstraction, but we argue it is also a privilege boundary that current models routinely exceed. We present FORTIS, a benchmark that evaluates over-privilege in agent skills across two stages: whether a model selects the minimally sufficient skill from a large overlapping library, and whether it executes that skill without expanding into broader tools or actions than the skill permits. Across ten frontier models and three domains, we find that over-privileged behavior is the norm rather than the exception. Models consistently reach for higher-privilege skills and tools than the task requires, failing at both stages at rates that remain high even for the strongest available models. Failure is especially severe under the ordinary conditions of real user interaction: incomplete specification, convenience framing, and proximity to skill boundaries. None of these requires adversarial construction. The results indicate that the skill layer, far from containing agent behavior, is itself a primary source of privilege escalation in current systems.