TACO: Tool-Geaugmenteerde Creditoptimalisatie voor Agentisch Toolgebruik
TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
June 29, 2026
Auteurs: Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao
cs.AI
Samenvatting
Agentische multimodale modellen voeren diverse bewerkingen uit op een afbeelding via code en redeneren over het teruggegeven aanzicht, een effectief paradigma voor fijnmazige visuele vraagbeantwoording. Code-operaties kunnen echter nuttig, overbodig of misleidend zijn. Alleen-uitkomstbeloningen kunnen deze gevallen niet precies onderscheiden, en bestaande procesbeloningen schrijven ofwel de uiteindelijke correctheid niet toe aan individuele toolaanroepen, of vereisen een extern beoordelingsmodel. Om dit aan te pakken introduceren we Tool-Augmented Credit Optimization (TACO), een GRPO-variant voor code-toolagenten die is gebouwd op twee gekoppelde voordeelkanalen. Het eerste, Differentiële Antwoord-Probe Beloning (DAPR), is een zelfgestuurd, beoordelingsvrij voordeel voor toolbijdrage dat elke toolaanroep crediteert op basis van het eigen effect op het correct beantwoorden. Probetokens die in de redenering van het model worden ingevoegd, ontlokken de voorspellingen met en zonder de tool, en het verschil in uitkomstbeloning wordt genomen als de waarde van de aanroep: positief voor een nuttige aanroep, negatief voor een misleidende, en nul voor een die niets verandert. Dit hergebruikt de bestaande antwoordcontroleur zonder hulpbeoordelaar en is, omdat het een verschil is in plaats van een absolute probescore, van nature robuust tegen probehacking. Het tweede is het uitkomstvoordeel van het uiteindelijke antwoord, verdeeld door Uitkomst-Gated Voordeel Routing (OGAR): een parameterloze regel die, afhankelijk van de uitkomst van de aanroep, dit krediet alleen aan de verantwoordelijke segmenten toewijst, waardoor verspilde toolaanroepen worden onderdrukt zonder enige kostenterm. We trainen TACO via een tweetraps SFT+RL-pijplijn. Uitgebreide experimenten op perceptie-, redeneer- en algemene multimodale benchmarks tonen aan dat het consistente nauwkeurigheidswinsten oplevert en leert zijn tools alleen in te zetten wanneer ze helpen.
English
Agentic multimodal models perform diverse operations on an image via code and reason over the returned view, an effective paradigm for fine-grained visual question answering. However, code operations can be useful, redundant, or misleading. Outcome-only rewards cannot precisely distinguish these cases, and existing process rewards either fail to attribute final correctness to individual tool calls, or require an external judge model. To address this, we introduce Tool-Augmented Credit Optimization (TACO), a GRPO variant for code-tool agents built on two coupled advantage channels. The first, Differential Answer-Probe Reward (DAPR), is a self-supervised, judge-free tool-contribution advantage that credits each tool call by its own effect on answering correctly. Probe tokens inserted into the model's reasoning elicit its predictions with and without the tool, and the difference in outcome reward is taken as the call's value: positive for a useful call, negative for a misleading one, and zero for one that changes nothing. This reuses the existing answer checker with no auxiliary judge, and, being a difference rather than an absolute probe score, is naturally robust to probe-hacking. The second is the outcome advantage from the final answer, distributed by Outcome-Gated Advantage Routing (OGAR): a parameter-free rule that, conditioned on the call's outcome, delivers this credit only to the responsible segments, suppressing wasted tool calls without any cost term. We train TACO through a two-stage SFT+RL pipeline. Extensive experiments across perception, reasoning, and general multimodal benchmarks show that it yields consistent accuracy gains and learns to invoke its tools only when they help.