SafePyramid: Een hiërarchische benchmark voor in-context beleidsbewaking
SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing
June 29, 2026
Auteurs: Jiacheng Zhang, Haoyu He, Sen Zhang, Shen Wang, Xiaolei Xu, Yuhao Sun, Meng Shen, Feng Liu
cs.AI
Samenvatting
In praktijktoepassingen wordt van guardrails vaak verwacht dat zij onveilige gebruikers-modelinteracties identificeren op basis van toepassingsspecifieke veiligheidsbeleid, in plaats van te vertrouwen op vooraf gedefinieerde risicotaxonomieën. In dit werk bestuderen we deze setting binnen het paradigma van in-context beleidsguardrailing, waarbij guardrails veiligheidsschendingen voorspellen op basis van beleidsspecificaties die in de context worden verstrekt. Om dit vermogen systematisch te evalueren, introduceren we SafePyramid, een veiligheidsbenchmark bestaande uit 1.000 meerroundsgesprekken in 10 domeinen en 3.000 bijbehorende toepassingsspecifieke beleidsregels, die samen 61.699 verschillende natuurlijke-taalregels bevatten. SafePyramid organiseert de evaluatie in drie moeilijkheidsniveaus: L0 evalueert het begrip van individuele regels, L1 evalueert het redeneren over regelafhankelijkheden, en L2 evalueert de aanpassing aan volledige nieuwe beleidskaders die in de context zijn gedefinieerd. Om de kwaliteit van de benchmark te waarborgen, gebruiken we een rigoureuze meerfasenpijplijn om de benchmark te construeren en te valideren. Met behulp van SafePyramid evalueren we 10 geavanceerde LLM's en 5 beleidsconfigureerbare guardrails en concluderen dat in-context beleidsguardrailing nog steeds zeer uitdagend is: zelfs het best presterende model, GPT-5.5, identificeert de volledige set geschonden regels in slechts 54,0%, 35,3% en 12,9% van de gevallen op respectievelijk L0, L1 en L2. Deze resultaten benadrukken de beperkingen van huidige guardrails en vragen om sterkere in-context beleidsguardrails die betrouwbaar beleid kunnen uitvoeren, regelafhankelijkheden kunnen oplossen en zich kunnen aanpassen aan nieuwe beleidskaders.
English
In real-world applications, guardrails are often expected to identify unsafe user-model interactions according to application-specific safety policies, rather than relying on predefined risk taxonomies. In this work, we study this setting under the paradigm of in-context policy guardrailing, where guardrails predict safety violations based on policy specifications provided in context. To systematically evaluate this capability, we introduce SafePyramid, a safety benchmark comprising 1,000 multi-turn conversations across 10 domains and 3,000 corresponding application-specific policies, which together contain 61,699 distinct natural-language rules. SafePyramid organizes the evaluation into three difficulty levels: L0 evaluates individual-rule understanding, L1 evaluates reasoning over rule dependencies, and L2 evaluates adaptation of full novel policy frameworks defined in context. To ensure benchmark quality, we employ a rigorous multi-stage pipeline to construct and validate the benchmark. Using SafePyramid, we evaluate 10 frontier LLMs and 5 policy-configurable guardrails and find that in-context policy guardrailing remains highly challenging: even the best-performing model, GPT-5.5, exactly identifies the full set of violated rules in only 54.0%, 35.3%, and 12.9% cases on L0, L1, and L2, respectively. These results highlight the limitations of current guardrails and call for stronger in-context policy guardrails that can reliably execute policies, resolve rule dependencies, and adapt to novel policy frameworks.