LLM-agenten weten al wanneer ze tools moeten aanroepen — zelfs zonder redeneren.
LLM Agents Already Know When to Call Tools -- Even Without Reasoning
May 10, 2026
Auteurs: Chung-En Sun, Linbo Liu, Ge Yan, Zimo Wang, Tsui-Wei Weng
cs.AI
Samenvatting
Met tools uitgebreide LLM-agenten hebben de neiging om gereedschappen zonder onderscheid aan te roepen, zelfs wanneer het model direct kan antwoorden. Elke onnodige aanroep verspilt API-kosten en latentie, maar geen enkele bestaande benchmark bestudeert systematisch wanneer een toolaanroep daadwerkelijk nodig is. Wij stellen When2Tool voor, een benchmark met 18 omgevingen (15 single-hop, 3 multi-hop) die drie categorieën van toolnoodzaak bestrijken – computationele schaal, kennisgrenzen en uitvoeringsbetrouwbaarheid – elk met gecontroleerde moeilijkheidsniveaus die een duidelijke beslissingsgrens creëren tussen tool-noodzakelijke en tool-onnodige taken. We evalueren twee families van trainingsvrije baselines: alleen prompt (waarbij de prompt wordt gevarieerd om onnodige aanroepen te ontmoedigen) en redeneer-dan-handel (waarbij het model moet nadenken over de toolnoodzaak voordat het handelt). Beide bieden beperkte controle: alleen-prompt onderdrukt noodzakelijke aanroepen naast onnodige, en redeneer-dan-handel brengt nog steeds een onevenredig hoge nauwkeurigheidskost met zich mee voor moeilijke taken. Om te begrijpen waarom deze baselines falen, onderzoeken we de verborgen toestanden van de modellen en vinden we dat toolnoodzaak lineair decodeerbaar is uit de representatie vóór generatie, met een AUROC van 0,89–0,96 over zes modellen, wat aanzienlijk beter is dan de eigen verwoorde redenering van het model. Dit onthult dat modellen al weten wanneer tools nodig zijn, maar er niet naar handelen tijdens het genereren. Voortbouwend op deze bevinding stellen we Probe&Prefill voor, die een lichtgewicht lineaire probe gebruikt om het signaal uit de verborgen toestand te lezen en de respons van het model vooraf invult met een sturende zin. Bij alle geteste modellen vermindert Probe&Prefill het aantal toolaanroepen met 48% met slechts 1,7% nauwkeurigheidsverlies, terwijl de beste baseline bij vergelijkbare nauwkeurigheid slechts 6% van de toolaanroepen vermindert, of een vergelijkbare vermindering van toolaanroepen bereikt maar een 5 keer hoger nauwkeurigheidsverlies oplevert. Onze code is beschikbaar op https://github.com/Trustworthy-ML-Lab/when2tool.
English
Tool-augmented LLM agents tend to call tools indiscriminately, even when the model can answer directly. Each unnecessary call wastes API fees and latency, yet no existing benchmark systematically studies when a tool call is actually needed. We propose When2Tool, a benchmark of 18 environments (15 single-hop, 3 multi-hop) spanning three categories of tool necessity -- computational scale, knowledge boundaries, and execution reliability -- each with controlled difficulty levels that create a clear decision boundary between tool-necessary and tool-unnecessary tasks. We evaluate two families of training-free baselines: Prompt-only (varying the prompt to discourage unnecessary calls) and Reason-then-Act (requiring the model to reason about tool necessity before acting). Both provide limited control: Prompt-only suppresses necessary calls alongside unnecessary ones, and Reason-then-Act still incurs a disproportionate accuracy cost on hard tasks. To understand why these baselines fail, we probe the models' hidden states and find that tool necessity is linearly decodable from the pre-generation representation with AUROC 0.89--0.96 across six models, substantially exceeding the model's own verbalized reasoning. This reveals that models already know when tools are needed, but fail to act on this knowledge during generation. Building on this finding, we propose Probe&Prefill, which uses a lightweight linear probe to read the hidden-state signal and prefills the model's response with a steering sentence. Across all models tested, Probe&Prefill reduces tool calls by 48% with only 1.7% accuracy loss, while the best baseline at comparable accuracy only reduces 6% of tool calls, or achieves a similar tool call reduction but incurs a 5times higher accuracy loss. Our code is available at https://github.com/Trustworthy-ML-Lab/when2tool