ChatPaper.aiChatPaper

Quando Privilégios Menores São Suficientes: Investigando a Seleção Excessivamente Privilegiada de Ferramentas em Agentes de LLM

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

June 18, 2026
Autores: Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang
cs.AI

Resumo

À medida que os agentes LLM selecionam ferramentas de forma cada vez mais autônoma, suas escolhas entre ferramentas com diferentes privilégios tornam-se relevantes para a segurança. No entanto, estudos anteriores sobre seleção de ferramentas concentram-se em preferências de metadados agnósticas à segurança, deixando escolhas sensíveis a privilégios pouco exploradas. Para preencher essa lacuna, estudamos a seleção de ferramentas com privilégios excessivos, na qual um agente seleciona ou escala para uma ferramenta de maior privilégio apesar de existir uma alternativa suficiente de menor privilégio. Apresentamos o ToolPrivBench para avaliar se os agentes escolhem ferramentas de maior privilégio apesar de existirem alternativas suficientes de menor privilégio, medindo tanto a seleção inicial quanto a escalada após falhas transitórias de ferramentas. Em oito domínios e cinco padrões de risco recorrentes, descobrimos que a seleção de ferramentas com privilégios excessivos é comum entre agentes LLM mainstream e é ainda amplificada por falhas transitórias. Constatamos ainda que o alinhamento geral de segurança não se transfere de forma confiável para a escolha de ferramentas de menor privilégio, enquanto os controles no nível de prompt fornecem apenas mitigação limitada sob falhas transitórias. Portanto, introduzimos uma defesa pós-treinamento ciente de privilégios que ensina os agentes a preferir ferramentas suficientes de menor privilégio e escalar apenas quando necessário. Nossos experimentos de mitigação mostram que essa defesa reduz substancialmente o uso desnecessário de ferramentas de alto privilégio, preservando as capacidades gerais.
English
As LLM agents increasingly select tools autonomously, their choices among tools with different privileges become safety-relevant. However, prior tool-selection studies focus on safety-agnostic metadata preferences, leaving privilege-sensitive choices underexplored. To address this gap, we study over-privileged tool selection, in which an agent selects or escalates to a higher-privilege tool despite a sufficient lower-privilege alternative. We introduce ToolPrivBench to evaluate whether agents choose higher-privilege tools despite sufficient lower-privilege alternatives, measuring both initial selection and escalation after transient tool failures. Across eight domains and five recurring risk patterns, we find that over-privileged tool selection is common among mainstream LLM agents and is further amplified by transient failures. We further find that general safety alignment does not reliably transfer to least-privilege tool choice, while prompt-level controls provide only limited mitigation under transient failures. We therefore introduce a privilege-aware post-training defense that teaches agents to prefer sufficient lower-privilege tools and escalate only when necessary. Our mitigation experiments show that this defense substantially reduces unnecessary high-privilege tool use while preserving general capabilities.