PolicyShiftGuard: Бенчмаркинг и улучшение адаптивных к политике защитных механизмов изображений
PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
July 7, 2026
Авторы: Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li
cs.AI
Аннотация
Защитные фильтры изображений обычно обучаются и оцениваются в условиях фиксированной политики безопасности, неявно трактуя безопасность как неотъемлемое свойство изображения. Реальные сценарии развертывания отличаются: одно и то же изображение может быть разрешено в одном продукте, ограничено в другом и вновь запрещено при изменении границ политики. Мы исследуем адаптируемую к политике защиту изображений (policy-adaptive image guardrailing), где модель должна решить, нарушает ли изображение текущую предоставленную политику, и обобщать на неизвестные ранее определения политик. Мы представляем PolicyShiftBench — комплексный тестовый набор, содержащий 2000 примеров, различающих политики, на основе 265 изображений. Каждое изображение в среднем снабжено 7,55 подсказками, обусловленными политикой, чтобы проверить, адаптируются ли модели к активной политике, а не полагаются на априорные представления об уровне безопасности изображения. Затем мы предлагаем PolicyShiftGuard — компактный защитный фильтр, обусловленный политикой, обученный с помощью двухэтапной методики, объединяющей SFT со случайной политикой (RP-SFT) и адаптацию по граничным парам политик (BP-Adapt). BP-Adapt обучает согласованные подсказки для одного и того же изображения и категории риска, используя стандартное наблюдение по меткам и потерю попарного сравнения, которая разделяет блокирующие политики и разрешающие политики. Эксперименты показывают, что существующие VLM и специализированные защитные фильтры остаются нестабильными при смене политик, в то время как PolicyShiftGuard существенно улучшает чувствительные к политике показатели. Модель с 7 млрд параметров достигает SOTA-результатов: средний F1 76,9 и средний PSS 72,1 на PolicyShiftBench, хорошо обобщается на UnSafeBench и SafeEditBench, а также улучшает компромисс между задержкой и производительностью за счет компактного выходного формата. Абляционные исследования подтверждают, что согласованные граничные пары «пропуск/блокировка» необходимы для стабильной адаптации к политикам.
English
Image guardrails are typically trained and evaluated under a fixed safety policy, implicitly treating safety as an intrinsic property of an image. Real deployments are different: the same image may be allowed in one product, restricted in another, and newly disallowed when a policy boundary changes. We study policy-adaptive image guardrailing, where a model must decide whether an image violates the currently supplied policy and generalize to held-out policy definitions. We introduce PolicyShiftBench, a comprehensive benchmark with 2,000 policy-discriminative instances over 265 images, where each image is paired with 7.55 policy-conditioned prompts on average to test whether models adapt to the active policy rather than relying on image-level safety priors. We then propose PolicyShiftGuard, a compact policy-conditioned guardrail trained with a two-stage training recipe that combines Randomized Policy SFT (RP-SFT) with Boundary-Pair Policy Adaptation (BP-Adapt). BP-Adapt trains matched prompts for the same image and risk category using standard label supervision and a pairwise comparison loss that separates blocking policies from passing policies. Experiments show that existing VLMs and specialized guardrails remain brittle under policy shifts, while PolicyShiftGuard substantially improves policy-sensitive performance. The 7B model achieves SOTA performance of 76.9 Avg. F1 and 72.1 Avg. PSS on PolicyShiftBench, transfers well to UnSafeBench and SafeEditBench, and improves the latency-performance trade-off with a concise output format. Ablations confirm that matched pass/block boundary pairs are essential for stable policy adaptation.