PolicyGuard: Um Verificador de Subagente Fundamentado em Diálogo para Adesão a Políticas em Agentes LLM
PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
June 28, 2026
Autores: Seongjae Kang, Taehyung Yu, Sung Ju Hwang
cs.AI
Resumo
Agentes de LLM processam solicitações de usuários em nome de organizações por meio de chamadas de ferramentas e devem seguir as políticas empresariais declaradas em seus prompts de sistema. Trabalhos anteriores tratam isso como um problema de salvaguarda — verificações externas que bloqueiam ações do agente não conformes. Argumentamos que a adesão às políticas é um problema mais amplo: fluxos de trabalho reais se desenrolam ao longo de muitos turnos, exigem confirmação explícita do usuário e leituras prévias necessárias, e dependem do conteúdo do diálogo, não de um único valor de argumento. Atender a esse padrão requer (i) contexto completo da conversa, (ii) autorreflexão sobre a política e o diálogo corrente, e (iii) remediação específica à conversa que oriente o próximo turno do agente — três capacidades que trabalhos anteriores de salvaguarda frequentemente subestimaram. Apresentamos o POLICYGUARD, um verificador subagente que compartilha a visão do agente sobre o diálogo, raciocina sobre a política em contexto e fornece feedback acionável para o próximo turno do agente. No tau^2-BENCH airline, em três fornecedores (GPT-5.4, Claude Sonnet 4.6, Gemini 2.5 Pro) com quatro tentativas por configuração, o POLICYGUARD melhora o PASS4 em +12,0 / +6,0 / +12,0 pontos percentuais. Análises por chamada mostram que o POLICYGUARD alcança maior recall de violação de políticas enquanto bloqueia aproximadamente metade das vezes em relação aos guardas em nível de argumento.
English
LLM agents handle user requests on behalf of organizations through tool calls and must follow the company policies stated in their system prompts. Prior work approaches this as a safeguarding problem -- external checks that block non-compliant agent actions. We argue that policy adherence is a broader problem: real workflows unfold across many turns, require explicit user confirmation and prerequisite reads, and hinge on the content of the dialogue rather than on any single argument value. Meeting this bar requires (i) full conversation context, (ii) self-reasoning over the policy and the current dialogue, and (iii) conversation-specific remediation that guides the agent's next turn -- three capabilities that prior safeguard work has often underestimated. We introduce POLICYGUARD, a sub-agent verifier that shares the agent's view of the dialogue, reasons over the policy in context, and provides actionable feedback for the agent's next turn. On tau^2-BENCH airline across three vendors (GPT-5.4, Claude Sonnet 4.6, Gemini 2.5 Pro) with four trials per setting, POLICYGUARD improves PASS4 by +12.0 / +6.0 / +12.0 pp. Per-call analyses show POLICYGUARD achieves higher policy-violation recall while blocking roughly half as often as argument-level guards.