ChatPaper.aiChatPaper

LedgerAgent: Estado Estruturado para Agentes de Chamada de Ferramentas Aderentes a Políticas

LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

June 18, 2026
Autores: Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral
cs.AI

Resumo

Agentes de chamada de ferramentas que aderem a políticas em domínios de atendimento ao cliente devem manter estados de tarefa ao longo de turnos, enquanto chamam ferramentas e obedecem a políticas de domínio. Estados de tarefa consistem em fatos relevantes, identificadores, restrições e condições observados por meio da interação com o usuário e de chamadas de ferramentas. Em agentes padrão, os estados de tarefa não são representados separadamente. Observações, retornos de ferramentas e instruções de política são colocados no prompt, deixando que os agentes reconstruam os estados relevantes a partir do prompt cada vez que decidem o que fazer em seguida. Esse design torna o gerenciamento de estados implícito, criando dois modos comuns de falha. Um agente pode recuperar os fatos corretos, mas posteriormente fundamentar sua decisão em informações desatualizadas, ausentes ou incorretas; e uma chamada de ferramenta sintaticamente válida ainda pode violar uma política de domínio que depende do estado de tarefa atual. Apresentamos LedgerAgent, um método em tempo de inferência para agentes de chamada de ferramentas que mantém os estados de tarefa observados em um ledger separado e renderiza os estados no prompt. O ledger também é usado para verificar restrições de política dependentes de estado antes da execução de chamadas de ferramentas que alteram o ambiente, bloqueando violações de política. Em quatro domínios de atendimento ao cliente e um painel misto de modelos de pesos abertos e fechados, LedgerAgent melhora a passk média em relação a uma abordagem padrão de chamada de ferramentas baseada em prompt, com os maiores ganhos sob métricas de consistência de múltiplas tentativas mais rigorosas.
English
Policy-adherent tool-calling agents in customer-service domains must maintain task states across turns while calling tools and obeying domain policies. Task states consist of relevant facts, identifiers, constraints, and conditions observed through user interaction and tool calls. In standard agents, task states are not represented separately. Observations, tool returns, and policy instructions are placed in the prompt, leaving agents to reconstruct the relevant states from the prompt each time they decide what to do next. This design makes state management implicit, creating two common failure modes. An agent may retrieve the right facts but later ground its decision in stale, missing, or incorrect information; and a syntactically valid tool call may still violate a domain policy that depends on the current task state. We introduce LedgerAgent, an inference-time method for tool-calling agents that maintains observed task states in a separate ledger and renders the states into the prompt. The ledger is also used to check state-dependent policy constraints before environment-changing tool calls are executed, blocking policy violations. Across four customer-service domains and a mixed panel of open- and closed-weight models, LedgerAgent improves average passk over a standard prompt-based tool-calling approach, with the largest gains under stricter multi-trial consistency metrics.