ChatPaper.aiChatPaper

PolicyShiftGuard: Evaluación comparativa y mejora de salvaguardas de imágenes adaptativas a políticas

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

July 7, 2026
Autores: Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li
cs.AI

Resumen

Las barreras de seguridad para imágenes suelen entrenarse y evaluarse bajo una política de seguridad fija, tratando implícitamente la seguridad como una propiedad intrínseca de la imagen. Los despliegues reales son diferentes: la misma imagen puede estar permitida en un producto, restringida en otro y ser recientemente prohibida cuando cambia el límite de una política. Estudiamos el guardrail de imágenes adaptativo a políticas, donde un modelo debe decidir si una imagen viola la política actualmente suministrada y generalizar a definiciones de política no vistas. Presentamos PolicyShiftBench, un benchmark completo con 2000 instancias discriminativas de políticas sobre 265 imágenes, donde cada imagen se empareja con 7,55 prompts condicionados por política en promedio para probar si los modelos se adaptan a la política activa en lugar de basarse en prioris de seguridad a nivel de imagen. Luego proponemos PolicyShiftGuard, un guardrail compacto condicionado por política entrenado con un procedimiento de entrenamiento en dos etapas que combina SFT con Políticas Aleatorizadas (RP-SFT) con Adaptación de Políticas por Pares Límite (BP-Adapt). BP-Adapt entrena prompts emparejados para la misma imagen y categoría de riesgo utilizando supervisión de etiquetas estándar y una pérdida de comparación por pares que separa las políticas de bloqueo de las políticas de aprobación. Los experimentos muestran que los VLM existentes y los guardrails especializados siguen siendo frágiles ante cambios de política, mientras que PolicyShiftGuard mejora sustancialmente el rendimiento sensible a políticas. El modelo de 7B alcanza un rendimiento SOTA de 76,9 F1 promedio y 72,1 PSS promedio en PolicyShiftBench, se transfiere bien a UnSafeBench y SafeEditBench, y mejora el compromiso entre latencia y rendimiento con un formato de salida conciso. Los ablaciones confirman que los pares de límites de aprobación/bloqueo emparejados son esenciales para una adaptación estable de políticas.
English
Image guardrails are typically trained and evaluated under a fixed safety policy, implicitly treating safety as an intrinsic property of an image. Real deployments are different: the same image may be allowed in one product, restricted in another, and newly disallowed when a policy boundary changes. We study policy-adaptive image guardrailing, where a model must decide whether an image violates the currently supplied policy and generalize to held-out policy definitions. We introduce PolicyShiftBench, a comprehensive benchmark with 2,000 policy-discriminative instances over 265 images, where each image is paired with 7.55 policy-conditioned prompts on average to test whether models adapt to the active policy rather than relying on image-level safety priors. We then propose PolicyShiftGuard, a compact policy-conditioned guardrail trained with a two-stage training recipe that combines Randomized Policy SFT (RP-SFT) with Boundary-Pair Policy Adaptation (BP-Adapt). BP-Adapt trains matched prompts for the same image and risk category using standard label supervision and a pairwise comparison loss that separates blocking policies from passing policies. Experiments show that existing VLMs and specialized guardrails remain brittle under policy shifts, while PolicyShiftGuard substantially improves policy-sensitive performance. The 7B model achieves SOTA performance of 76.9 Avg. F1 and 72.1 Avg. PSS on PolicyShiftBench, transfers well to UnSafeBench and SafeEditBench, and improves the latency-performance trade-off with a concise output format. Ablations confirm that matched pass/block boundary pairs are essential for stable policy adaptation.