ChatPaper.aiChatPaper

PolicyShiftGuard : Évaluation comparative et amélioration des garde-fous d'image adaptatifs aux politiques

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

July 7, 2026
Auteurs: Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li
cs.AI

Résumé

Les garde-fous d'image sont généralement entraînés et évalués sous une politique de sécurité fixe, traitant implicitement la sécurité comme une propriété intrinsèque d'une image. Les déploiements réels sont différents : la même image peut être autorisée dans un produit, restreinte dans un autre, et nouvellement interdite lorsqu'une limite de politique change. Nous étudions le garde-fou d'image adaptatif aux politiques, où un modèle doit décider si une image viole la politique actuellement fournie et généraliser à des définitions de politiques non vues. Nous introduisons PolicyShiftBench, un référentiel complet avec 2 000 instances discriminantes par politiques sur 265 images, où chaque image est associée en moyenne à 7,55 invites conditionnées par politique pour tester si les modèles s'adaptent à la politique active plutôt que de se fier à des a priori de sécurité au niveau de l'image. Nous proposons ensuite PolicyShiftGuard, un garde-fou compact conditionné par politique, entraîné avec une méthode en deux étapes combinant l'entraînement supervisé fin par politiques randomisées (RP-SFT) avec l'adaptation par paires de politiques aux limites (BP-Adapt). BP-Adapt entraîne des invites appariées pour la même image et la même catégorie de risque en utilisant une supervision par étiquettes standard et une perte de comparaison par paires qui sépare les politiques de blocage des politiques de passage. Les expériences montrent que les VLM existants et les garde-fous spécialisés restent fragiles face aux changements de politique, tandis que PolicyShiftGuard améliore considérablement les performances sensibles aux politiques. Le modèle 7B atteint des performances de pointe de 76,9 de F1 moyen et 72,1 de PSS moyen sur PolicyShiftBench, se transfère bien à UnSafeBench et SafeEditBench, et améliore le compromis latence-performance avec un format de sortie concis. Les ablations confirment que les paires appariées de limites passage/blocage sont essentielles pour une adaptation stable aux politiques.
English
Image guardrails are typically trained and evaluated under a fixed safety policy, implicitly treating safety as an intrinsic property of an image. Real deployments are different: the same image may be allowed in one product, restricted in another, and newly disallowed when a policy boundary changes. We study policy-adaptive image guardrailing, where a model must decide whether an image violates the currently supplied policy and generalize to held-out policy definitions. We introduce PolicyShiftBench, a comprehensive benchmark with 2,000 policy-discriminative instances over 265 images, where each image is paired with 7.55 policy-conditioned prompts on average to test whether models adapt to the active policy rather than relying on image-level safety priors. We then propose PolicyShiftGuard, a compact policy-conditioned guardrail trained with a two-stage training recipe that combines Randomized Policy SFT (RP-SFT) with Boundary-Pair Policy Adaptation (BP-Adapt). BP-Adapt trains matched prompts for the same image and risk category using standard label supervision and a pairwise comparison loss that separates blocking policies from passing policies. Experiments show that existing VLMs and specialized guardrails remain brittle under policy shifts, while PolicyShiftGuard substantially improves policy-sensitive performance. The 7B model achieves SOTA performance of 76.9 Avg. F1 and 72.1 Avg. PSS on PolicyShiftBench, transfers well to UnSafeBench and SafeEditBench, and improves the latency-performance trade-off with a concise output format. Ablations confirm that matched pass/block boundary pairs are essential for stable policy adaptation.