FORTIS: Benchmarken van Overprivilege in Agentvaardigheden
FORTIS: Benchmarking Over-Privilege in Agent Skills
May 9, 2026
Auteurs: Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhang, Yue Zhao
cs.AI
Samenvatting
Grootschalige taalmodellen opereren steeds vaker via een tussenliggende vaardigheidslaag die bemiddelt tussen gebruikersintentie en concrete taakuitvoering. Deze laag wordt algemeen beschouwd als een organisatorische abstractie, maar wij stellen dat het tevens een priviligegrens is die huidige modellen routinematig overschrijden. Wij presenteren FORTIS, een benchmark die overbevoegdheid in agentvaardigheden evalueert in twee fasen: of een model de minimaal toereikende vaardigheid selecteert uit een grote overlappende bibliotheek, en of het die vaardigheid uitvoert zonder uit te breiden naar bredere hulpmiddelen of acties dan de vaardigheid toestaat. Over tien geavanceerde modellen en drie domeinen heen vinden wij dat overbevoegd gedrag de norm is in plaats van de uitzondering. Modellen grijpen consequent naar vaardigheden en hulpmiddelen met een hogere bevoegdheid dan de taak vereist, en falen in beide fasen met percentages die zelfs voor de sterkste beschikbare modellen hoog blijven. Falen is bijzonder ernstig onder de alledaagse omstandigheden van echte gebruikersinteractie: onvolledige specificatie, gemaksframing, en nabijheid van vaardigheidsgrenzen. Geen van deze vereist een vijandige constructie. De resultaten geven aan dat de vaardigheidslaag, verre van agentgedrag in te perken, zelf een primaire bron van privilege-escaltie is in huidige systemen.
English
Large language model agents increasingly operate through an intermediate skill layer that mediates between user intent and concrete task execution. This layer is widely treated as an organizational abstraction, but we argue it is also a privilege boundary that current models routinely exceed. We present FORTIS, a benchmark that evaluates over-privilege in agent skills across two stages: whether a model selects the minimally sufficient skill from a large overlapping library, and whether it executes that skill without expanding into broader tools or actions than the skill permits. Across ten frontier models and three domains, we find that over-privileged behavior is the norm rather than the exception. Models consistently reach for higher-privilege skills and tools than the task requires, failing at both stages at rates that remain high even for the strongest available models. Failure is especially severe under the ordinary conditions of real user interaction: incomplete specification, convenience framing, and proximity to skill boundaries. None of these requires adversarial construction. The results indicate that the skill layer, far from containing agent behavior, is itself a primary source of privilege escalation in current systems.