ChatPaper.aiChatPaper

SingGuard: Salvaguarda para LLM Multimodal Adaptável a Políticas com Raciocínio Dinâmico

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

June 22, 2026
Autores: SingGuard Team
cs.AI

Resumo

Modelos de visão-linguagem (VLMs) estão cada vez mais sendo implantados em aplicações de consumo, médicas, financeiras e empresariais. Essa ampla implantação expande a superfície de segurança: riscos podem surgir de respostas a perguntas multimodais, respostas de assistentes e composição cross-modal, enquanto as políticas de moderação podem variar entre produtos, regiões e estágios de implantação. A maioria das proteções existentes depende de taxonomias fixas ou visa apenas um conjunto restrito de configurações de interação, o que limita sua adaptabilidade quando as regras de segurança mudam no momento da implantação. Apresentamos o SingGuard, uma família de modelos de proteção multimodal adaptáveis a políticas para avaliação de segurança em conversas multimodais. O SingGuard trata a política ativa como uma entrada em tempo de execução: dadas regras em linguagem natural, ele verifica o conteúdo alvo em relação à política ativa, regra por regra, e prevê tanto o rótulo de segurança quanto a regra acionada. Para equilibrar eficiência e interpretabilidade, o SingGuard suporta regimes de inferência rápida, híbrida e lenta ao longo de um espectro de raciocínio rápido-para-lento, variando de julgamentos diretos de segurança a deliberação fundamentada em política. Otimizamos ainda esse comportamento com aprendizado por reforço desacoplado rápido-lento. Também apresentamos o SingGuard-Bench, um benchmark de proteção multimodal com 56.340 exemplos abrangendo mais de 80 tipos de risco detalhados em configurações de QA multimodal, ataque adversarial e avaliação dinâmica de regras, incluindo casos de risco conjunto cross-modal onde cada modalidade é inofensiva isoladamente, mas sua composição implica intenção insegura. Em seis famílias de benchmark (35 conjuntos de dados), o SingGuard alcança o F1 médio estado da arte em cada família. A avaliação dinâmica de regras mostra ainda precisão melhorada de seguimento de política de 0,6465 para 0,7415 sob mudanças de política em tempo de execução. Nosso código está disponível em https://github.com/inclusionAI/Sing-Guard.
English
Vision-language models (VLMs) are increasingly deployed in consumer, medical, financial, and enterprise applications. This broad deployment expands the safety surface: risks can arise from multimodal question answering, assistant responses, and cross-modal composition, while moderation policies may vary across products, regions, and deployment stages. Most existing guardrails either rely on fixed taxonomies or target only a narrow set of interaction settings, which limits their adaptability when safety rules change at deployment time. We present SingGuard, a policy-adaptive multimodal guardrail model family for safety assessment in multimodal conversations. SingGuard treats the active policy as a runtime input: given natural-language rules, it checks the target content against the active policy rule by rule and predicts both the safety label and the triggered rule. To balance efficiency and interpretability, SingGuard supports fast, hybrid, and slow inference regimes along a fast-to-slow reasoning spectrum, ranging from direct safety judgments to policy-grounded deliberation. We further optimize this behavior with fast--slow decoupled reinforcement learning. We also introduce SingGuard-Bench, a multimodal guardrail benchmark with 56{,}340 examples spanning 80+ fine-grained risk types across multimodal QA, adversarial attack, and dynamic-rule evaluation settings, including cross-modal joint-risk cases where each modality is harmless in isolation but their composition implies unsafe intent. Across six benchmark families (35 datasets), SingGuard achieves state-of-the-art average F1 in every family. Dynamic-rule evaluation further shows improved policy-following accuracy from 0.6465 to 0.7415 under runtime policy shifts. Our code is available at https://github.com/inclusionAI/Sing-Guard.