ChatPaper.aiChatPaper

PolicyShiftGuard: Benchmarking und Verbesserung richtlinienadaptiver Bildschutzmaßnahmen

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

July 7, 2026
Autoren: Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li
cs.AI

Zusammenfassung

Bild-Schutzmechanismen werden typischerweise unter einer festen Sicherheitsrichtlinie trainiert und evaluiert, wobei Sicherheit implizit als intrinsische Eigenschaft eines Bildes behandelt wird. Reale Einsatzumgebungen unterscheiden sich jedoch: Dasselbe Bild kann in einem Produkt erlaubt, in einem anderen eingeschränkt und bei einer Änderung der Richtliniengrenze neu verboten sein. Wir untersuchen richtlinienadaptive Bild-Schutzmechanismen, bei denen ein Modell entscheiden muss, ob ein Bild die aktuell bereitgestellte Richtlinie verletzt, und auf ausgelassene Richtliniendefinitionen verallgemeinern muss. Wir führen PolicyShiftBench ein, einen umfassenden Benchmark mit 2.000 richtliniendiskriminierenden Instanzen über 265 Bilder, bei dem jedes Bild durchschnittlich mit 7,55 richtlinienabhängigen Aufforderungen (Prompts) gepaart wird, um zu testen, ob Modelle sich an die aktive Richtlinie anpassen, anstatt sich auf Sicherheitsvorkenntnisse auf Bildebene zu stützen. Anschließend schlagen wir PolicyShiftGuard vor, einen kompakten, richtlinienabhängigen Schutzmechanismus, der mit einem zweistufigen Trainingsrezept trainiert wird, das Randomized Policy SFT (RP-SFT) mit Boundary-Pair Policy Adaptation (BP-Adapt) kombiniert. BP-Adapt trainiert passende Aufforderungen für dasselbe Bild und dieselbe Risikokategorie unter Verwendung standardmäßiger Label-Überwachung und eines paarweisen Vergleichsverlusts, der sperrende Richtlinien von passierenden Richtlinien trennt. Experimente zeigen, dass bestehende VLMs (Vision-Language-Modelle) und spezialisierte Schutzmechanismen unter Richtlinienwechseln spröde bleiben, während PolicyShiftGuard die richtlinienempfindliche Leistung erheblich verbessert. Das 7B-Modell erreicht SOTA-Leistung (State-of-the-Art) von 76,9 durchschnittlichem F1 und 72,1 durchschnittlichem PSS auf PolicyShiftBench, überträgt sich gut auf UnSafeBench und SafeEditBench und verbessert den Latenz-Leistungs-Kompromiss durch ein prägnantes Ausgabeformat. Ablationen bestätigen, dass passende Paare von Grenzen zwischen Passieren und Blockieren für eine stabile Richtlinienanpassung unerlässlich sind.
English
Image guardrails are typically trained and evaluated under a fixed safety policy, implicitly treating safety as an intrinsic property of an image. Real deployments are different: the same image may be allowed in one product, restricted in another, and newly disallowed when a policy boundary changes. We study policy-adaptive image guardrailing, where a model must decide whether an image violates the currently supplied policy and generalize to held-out policy definitions. We introduce PolicyShiftBench, a comprehensive benchmark with 2,000 policy-discriminative instances over 265 images, where each image is paired with 7.55 policy-conditioned prompts on average to test whether models adapt to the active policy rather than relying on image-level safety priors. We then propose PolicyShiftGuard, a compact policy-conditioned guardrail trained with a two-stage training recipe that combines Randomized Policy SFT (RP-SFT) with Boundary-Pair Policy Adaptation (BP-Adapt). BP-Adapt trains matched prompts for the same image and risk category using standard label supervision and a pairwise comparison loss that separates blocking policies from passing policies. Experiments show that existing VLMs and specialized guardrails remain brittle under policy shifts, while PolicyShiftGuard substantially improves policy-sensitive performance. The 7B model achieves SOTA performance of 76.9 Avg. F1 and 72.1 Avg. PSS on PolicyShiftBench, transfers well to UnSafeBench and SafeEditBench, and improves the latency-performance trade-off with a concise output format. Ablations confirm that matched pass/block boundary pairs are essential for stable policy adaptation.