ChatPaper.aiChatPaper

Abstenção Agentiva: Os Agentes Sabem Quando Parar em Vez de Agir?

Agentic Abstention: Do Agents Know When to Stop Instead of Act?

June 27, 2026
Autores: Han Luo, Bingbing Wen, Lucy Lu Wang
cs.AI

Resumo

Agentes de LLM devem atuar em múltiplas rodadas, utilizando mecanismos de busca, interfaces de navegação e ferramentas de terminal para cumprir objetivos do usuário. No entanto, nem todo objetivo é bem especificado ou realizável no ambiente disponível. Nesses casos, um agente confiável deve reconhecer que interações adicionais provavelmente não ajudarão e abster-se de novas chamadas de ferramentas. Definimos Abstenção Agentiva, o problema de decidir quando um agente deve parar de atuar sob incerteza. Diferentemente da abstenção padrão em LLMs, geralmente avaliada como uma decisão de responder ou abster-se em uma única rodada, a abstenção agentiva é um problema de decisão sequencial: a cada rodada, um agente pode responder, abster-se ou coletar mais informações, e a necessidade de abster-se pode se tornar clara apenas após interagir com o ambiente. Estudamos esse problema em ambientes de compras na web, terminais e resposta a perguntas, avaliando 13 sistemas de agente baseados em LLM e 2 arcabouços de agente em mais de 28.000 tarefas. Nossos resultados mostram que o principal desafio não é apenas se os agentes conseguem se abster, mas também quando eles se abstêm. Alguns agentes nunca se abstêm quando deveriam, enquanto outros só o fazem após muitas interações desnecessárias. Essa lacuna é especialmente grande em tarefas onde a instrução parece viável até que o ambiente revele o contrário (por exemplo, nenhum resultado válido corresponde à instrução). Adicionalmente, descobrimos que a escala do modelo, o raciocínio e o arcabouço do agente afetam a abstenção de maneiras distintas, onde modelos maiores ou mais capazes às vezes apresentam pior desempenho em abstenção oportuna. Por fim, introduzimos CONVOLVE, um método de engenharia de contexto para melhorar a abstenção agentiva que destila trajetórias completas de interação em regras de parada reutilizáveis. No WebShop, o CONVOLVE melhora substancialmente a abstenção oportuna sem atualizar parâmetros do modelo, elevando a taxa de recall oportuno do Llama-3.3-70B de 26,7 para 57,4. Nosso conjunto de dados e código estão disponíveis em https://lhannnn.github.io/agentic-abstention
English
LLM agents are expected to act over multiple turns, using search, browsing interfaces, and terminal tools to complete user goals. Yet not every goal is well specified or achievable in the available environment. In such cases, a reliable agent should recognize that further interaction is unlikely to help and abstain from additional tool calls. We define Agentic Abstention, the problem of deciding when an agent should stop acting under uncertainty. Unlike standard LLM abstention, which is usually evaluated as a single-turn answer-or-abstain decision, agentic abstention is a sequential decision problem: an agent can answer, abstain, or gather more information at each turn, and the need to abstain may only become clear after interacting with the environment. We study this problem across web shopping, terminal environments, and question answering, evaluating 13 LLM-as-agent systems and 2 agent scaffolds on more than 28,000 tasks. Our results show that the main challenge is not only whether agents can abstain, but also when they abstain. Some agents never abstain when they should, while others do so only after many unnecessary interactions. This gap is especially large on tasks where the instruction appears feasible until the environment reveals otherwise (e.g., no valid result matches the instruction). We further find that model scale, reasoning, and agent scaffolding affect abstention in different ways, where larger or more capable models sometimes perform worse at timely abstention. Finally, we introduce CONVOLVE, a context engineering method for improving agentic abstention that distills full interaction trajectories into reusable stopping rules. On WebShop, CONVOLVE substantially improves timely abstention without updating model parameters, raising Llama-3.3-70B's timely recall rate from 26.7 to 57.4. Our dataset and code are available at https://lhannnn.github.io/agentic-abstention