TACO: Otimização de Crédito Aumentada por Ferramentas para Uso Agentivo de Ferramentas
TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
June 29, 2026
Autores: Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao
cs.AI
Resumo
Modelos multimodais agentivos realizam operações diversas em uma imagem por meio de código e raciocinam sobre a visualização retornada, constituindo um paradigma eficaz para resposta a perguntas visuais de granularidade fina. No entanto, operações de código podem ser úteis, redundantes ou enganosas. Recompensas baseadas apenas no resultado não conseguem distinguir precisamente esses casos, e as recompensas de processo existentes ou falham em atribuir a correção final a chamadas individuais de ferramentas, ou exigem um modelo de julgamento externo. Para resolver isso, apresentamos a Otimização de Crédito Aumentada por Ferramentas (TACO), uma variante de GRPO para agentes de ferramentas de código construída sobre dois canais de vantagem acoplados. O primeiro, a Recompensa Diferencial de Sonda de Resposta (DAPR), é uma vantagem de contribuição de ferramenta auto-supervisionada e sem juiz, que credita cada chamada de ferramenta pelo seu próprio efeito na resposta correta. Tokens de sonda inseridos no raciocínio do modelo elicitam suas previsões com e sem a ferramenta, e a diferença na recompensa do resultado é tomada como o valor da chamada: positivo para uma chamada útil, negativo para uma chamada enganosa e zero para uma que não altera nada. Isso reutiliza o verificador de respostas existente sem um juiz auxiliar e, por ser uma diferença em vez de uma pontuação absoluta de sonda, é naturalmente robusto à manipulação de sonda. O segundo é a vantagem do resultado proveniente da resposta final, distribuída pelo Roteamento de Vantagem Controlado por Resultado (OGAR): uma regra sem parâmetros que, condicionada ao resultado da chamada, entrega esse crédito apenas aos segmentos responsáveis, suprimindo chamadas de ferramentas desperdiçadas sem qualquer termo de custo. Treinamos o TACO por meio de um pipeline de SFT+RL em dois estágios. Extensos experimentos em benchmarks de percepção, raciocínio e gerais multimodais mostram que ele produz ganhos consistentes de precisão e aprende a invocar suas ferramentas apenas quando elas ajudam.
English
Agentic multimodal models perform diverse operations on an image via code and reason over the returned view, an effective paradigm for fine-grained visual question answering. However, code operations can be useful, redundant, or misleading. Outcome-only rewards cannot precisely distinguish these cases, and existing process rewards either fail to attribute final correctness to individual tool calls, or require an external judge model. To address this, we introduce Tool-Augmented Credit Optimization (TACO), a GRPO variant for code-tool agents built on two coupled advantage channels. The first, Differential Answer-Probe Reward (DAPR), is a self-supervised, judge-free tool-contribution advantage that credits each tool call by its own effect on answering correctly. Probe tokens inserted into the model's reasoning elicit its predictions with and without the tool, and the difference in outcome reward is taken as the call's value: positive for a useful call, negative for a misleading one, and zero for one that changes nothing. This reuses the existing answer checker with no auxiliary judge, and, being a difference rather than an absolute probe score, is naturally robust to probe-hacking. The second is the outcome advantage from the final answer, distributed by Outcome-Gated Advantage Routing (OGAR): a parameter-free rule that, conditioned on the call's outcome, delivers this credit only to the responsible segments, suppressing wasted tool calls without any cost term. We train TACO through a two-stage SFT+RL pipeline. Extensive experiments across perception, reasoning, and general multimodal benchmarks show that it yields consistent accuracy gains and learns to invoke its tools only when they help.