ChatPaper.aiChatPaper

PrivacyAlign: Alinhamento de Privacidade Contextual para Agentes LLM

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

June 19, 2026
Autores: Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet, Perouz Taslakian, Jimmy Lin, Spandana Gella
cs.AI

Resumo

Agentes de IA que atuam em nome dos usuários tomam decisões constantemente, e para que os usuários confiem em seus agentes, essas decisões devem estar alinhadas com o que eles realmente desejam. A privacidade é um problema fundamental de alinhamento para agentes: cada mensagem, postagem ou chamada de ferramenta feita por um agente envolve um julgamento contextual sobre o que é apropriado compartilhar, com quem e sob quais condições. Como tais julgamentos dependem de expectativas e normas sociais, o julgamento humano não apenas rotula violações de privacidade, mas também ajuda a defini-las. Embora trabalhos existentes dependam de proxies não confiáveis tanto para treinamento quanto para avaliação, colocamos o julgamento humano no centro do alinhamento de privacidade de agentes. Apresentamos o PrivacyAlign, um conjunto de dados com 1.350 amostras e 3.516 anotações detalhadas de 599 anotadores únicos em diversos cenários onde os LLMs atuais realmente vazam informações, e o utilizamos para fundamentar tanto o treinamento de alinhamento quanto a avaliação automatizada em normas humanas de privacidade. Com base nessas anotações, primeiro mostramos que condicionar avaliadores LLM a anotações e explicações humanas para respostas de referência ao mesmo prompt torna seus julgamentos mais confiáveis. Em seguida, introduzimos a modelagem de recompensa condicionada a anotações, que usa essas anotações para pontuar novas respostas durante o RL, e mostramos que pequenos agentes de peso aberto treinados com essa recompensa se alinham melhor às normas humanas de privacidade, com ganhos significativos no PrivacyAlign e em benchmarks de privacidade existentes para agentes.
English
AI agents acting on behalf of users are constantly making decisions, and for users to trust their agents, those decisions must align with what they actually want. Privacy is an important alignment problem for agents: every message, post, or tool call an agent makes is a contextual judgment about what is appropriate to share, with whom, and under which conditions. Because such judgments depend on social expectations and norms, human judgment does not merely label privacy violations but also helps define them. While existing work relies on unreliable proxies for both training and evaluation, we place human judgment at the center of agentic privacy alignment. We introduce PrivacyAlign, a dataset of 1,350 samples with 3,516 detailed annotations from 599 unique annotators across diverse scenarios where current LLMs actually leak, and use it to ground both alignment training and automated evaluation in human privacy norms. Building on these annotations, we first show that conditioning LLM judges on human annotations and explanations for reference responses to the same prompt makes their judgments more reliable. We then introduce annotation-conditioned reward modeling, which uses these annotations to score new responses during RL, and show that small open-weight agents trained with this reward better align with human privacy norms, with strong gains on PrivacyAlign and existing privacy benchmarks for agents.