ChatPaper.aiChatPaper

Agentes LLM já sabem quando chamar ferramentas -- mesmo sem raciocínio.

LLM Agents Already Know When to Call Tools -- Even Without Reasoning

May 10, 2026
Autores: Chung-En Sun, Linbo Liu, Ge Yan, Zimo Wang, Tsui-Wei Weng
cs.AI

Resumo

Agentes LLM aumentados com ferramentas tendem a chamar ferramentas indiscriminadamente, mesmo quando o modelo pode responder diretamente. Cada chamada desnecessária desperdiça custos de API e latência, mas nenhum benchmark existente estuda sistematicamente quando uma chamada de ferramenta é realmente necessária. Propomos o When2Tool, um benchmark de 18 ambientes (15 de salto único, 3 de múltiplos saltos) abrangendo três categorias de necessidade de ferramenta — escala computacional, limites de conhecimento e confiabilidade de execução — cada uma com níveis de dificuldade controlados que criam uma fronteira clara de decisão entre tarefas que necessitam e que não necessitam de ferramenta. Avaliamos duas famílias de baselines sem treinamento: apenas prompt (variando o prompt para desencorajar chamadas desnecessárias) e raciocinar-depois-agir (exigindo que o modelo raciocine sobre a necessidade da ferramenta antes de agir). Ambas oferecem controle limitado: o apenas prompt suprime chamadas necessárias junto com as desnecessárias, e o raciocinar-depois-agir ainda impõe um custo desproporcional de acurácia em tarefas difíceis. Para entender por que esses baselines falham, investigamos os estados ocultos dos modelos e descobrimos que a necessidade de ferramenta é linearmente decodificável a partir da representação pré-geração com AUROC de 0,89–0,96 em seis modelos, superando substancialmente o raciocínio verbalizado do próprio modelo. Isso revela que os modelos já sabem quando as ferramentas são necessárias, mas falham em agir com base nesse conhecimento durante a geração. Partindo dessa descoberta, propomos o Probe&Prefill, que usa uma sonda linear leve para ler o sinal do estado oculto e preenche a resposta do modelo com uma frase de direcionamento. Em todos os modelos testados, o Probe&Prefill reduz as chamadas de ferramenta em 48% com apenas 1,7% de perda de acurácia, enquanto o melhor baseline com acurácia comparável reduz apenas 6% das chamadas, ou alcança uma redução similar de chamadas, mas com uma perda de acurácia 5 vezes maior. Nosso código está disponível em https://github.com/Trustworthy-ML-Lab/when2tool.
English
Tool-augmented LLM agents tend to call tools indiscriminately, even when the model can answer directly. Each unnecessary call wastes API fees and latency, yet no existing benchmark systematically studies when a tool call is actually needed. We propose When2Tool, a benchmark of 18 environments (15 single-hop, 3 multi-hop) spanning three categories of tool necessity -- computational scale, knowledge boundaries, and execution reliability -- each with controlled difficulty levels that create a clear decision boundary between tool-necessary and tool-unnecessary tasks. We evaluate two families of training-free baselines: Prompt-only (varying the prompt to discourage unnecessary calls) and Reason-then-Act (requiring the model to reason about tool necessity before acting). Both provide limited control: Prompt-only suppresses necessary calls alongside unnecessary ones, and Reason-then-Act still incurs a disproportionate accuracy cost on hard tasks. To understand why these baselines fail, we probe the models' hidden states and find that tool necessity is linearly decodable from the pre-generation representation with AUROC 0.89--0.96 across six models, substantially exceeding the model's own verbalized reasoning. This reveals that models already know when tools are needed, but fail to act on this knowledge during generation. Building on this finding, we propose Probe&Prefill, which uses a lightweight linear probe to read the hidden-state signal and prefills the model's response with a steering sentence. Across all models tested, Probe&Prefill reduces tool calls by 48% with only 1.7% accuracy loss, while the best baseline at comparable accuracy only reduces 6% of tool calls, or achieves a similar tool call reduction but incurs a 5times higher accuracy loss. Our code is available at https://github.com/Trustworthy-ML-Lab/when2tool