Agentische Onthouding: Weten agenten wanneer ze moeten stoppen in plaats van handelen?
Agentic Abstention: Do Agents Know When to Stop Instead of Act?
June 27, 2026
Auteurs: Han Luo, Bingbing Wen, Lucy Lu Wang
cs.AI
Samenvatting
LLM-agenten worden geacht over meerdere beurten te handelen, waarbij zij gebruik maken van zoekopdrachten, browse-interfaces en terminaltools om gebruikersdoelen te volbrengen. Toch is niet elk doel goed gespecificeerd of haalbaar in de beschikbare omgeving. In dergelijke gevallen dient een betrouwbare agent te herkennen dat verdere interactie waarschijnlijk geen zin heeft en af te zien van extra toolaanroepen. Wij definiëren Agentische Onthouding, het probleem van beslissen wanneer een agent moet stoppen met handelen onder onzekerheid. In tegenstelling tot standaard LLM-onthouding, die doorgaans wordt geëvalueerd als een eenmalige antwoord-of-onthoud-beslissing, is agentische onthouding een sequentieel beslissingsprobleem: een agent kan per beurt antwoorden, zich onthouden of meer informatie verzamelen, en de noodzaak tot onthouding kan pas duidelijk worden na interactie met de omgeving. We bestuderen dit probleem in webshoppen, terminalomgevingen en vraagbeantwoording, waarbij we 13 LLM-als-agent-systemen en 2 agent-scaffolds evalueren op meer dan 28.000 taken. Onze resultaten tonen aan dat de grootste uitdaging niet alleen is of agenten zich kunnen onthouden, maar ook wanneer zij dat doen. Sommige agenten onthouden zich nooit wanneer dat zou moeten, terwijl anderen dat pas doen na vele onnodige interacties. Deze kloof is bijzonder groot bij taken waarbij de instructie haalbaar lijkt totdat de omgeving het tegendeel laat zien (bijvoorbeeld geen geldig resultaat dat overeenkomt met de instructie). Verder vinden we dat modelschaal, redeneren en agent-scaffolding de onthouding op verschillende manieren beïnvloeden, waarbij grotere of capabelere modellen soms slechter presteren op tijdige onthouding. Ten slotte introduceren we CONVOLVE, een contextengineeringmethode voor het verbeteren van agentische onthouding die volledige interactietrajecten destilleert tot herbruikbare stopregels. Op WebShop verbetert CONVOLVE de tijdige onthouding aanzienlijk zonder modelparameters aan te passen, waardoor de tijdige herkenningsratio van Llama-3.3-70B stijgt van 26,7 naar 57,4. Onze dataset en code zijn beschikbaar op https://lhannnn.github.io/agentic-abstention.
English
LLM agents are expected to act over multiple turns, using search, browsing interfaces, and terminal tools to complete user goals. Yet not every goal is well specified or achievable in the available environment. In such cases, a reliable agent should recognize that further interaction is unlikely to help and abstain from additional tool calls. We define Agentic Abstention, the problem of deciding when an agent should stop acting under uncertainty. Unlike standard LLM abstention, which is usually evaluated as a single-turn answer-or-abstain decision, agentic abstention is a sequential decision problem: an agent can answer, abstain, or gather more information at each turn, and the need to abstain may only become clear after interacting with the environment. We study this problem across web shopping, terminal environments, and question answering, evaluating 13 LLM-as-agent systems and 2 agent scaffolds on more than 28,000 tasks. Our results show that the main challenge is not only whether agents can abstain, but also when they abstain. Some agents never abstain when they should, while others do so only after many unnecessary interactions. This gap is especially large on tasks where the instruction appears feasible until the environment reveals otherwise (e.g., no valid result matches the instruction). We further find that model scale, reasoning, and agent scaffolding affect abstention in different ways, where larger or more capable models sometimes perform worse at timely abstention. Finally, we introduce CONVOLVE, a context engineering method for improving agentic abstention that distills full interaction trajectories into reusable stopping rules. On WebShop, CONVOLVE substantially improves timely abstention without updating model parameters, raising Llama-3.3-70B's timely recall rate from 26.7 to 57.4. Our dataset and code are available at https://lhannnn.github.io/agentic-abstention