ChatPaper.aiChatPaper

Taxa de Restrição em LLMs de Peso Aberto: Um Estudo Empírico da Supressão de Chamadas de Ferramentas sob Restrições de Saída Estruturada

Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints

June 24, 2026
Autores: Fangzheng Li, Aimin Zhang, Chen Lv
cs.AI

Resumo

Chamada de Ferramentas e Saída Estruturada são duas capacidades centrais de sistemas modernos de Agentes, mas sua interação sob condições de implantação conjunta ainda não é suficientemente compreendida. Este artigo relata um fenômeno reproduzível observado em um sistema Agente de produção: quando a Chamada de Ferramentas e as restrições de Esquema JSON são habilitadas simultaneamente, múltiplos modelos de peso aberto deixam de invocar ferramentas, embora mantenham alta conformidade com o esquema. Referimo-nos a esse comportamento como Supressão de Ferramentas. Por meio de experimentos controlados em várias famílias de modelos e configurações de implantação, reproduzimos consistentemente a Supressão de Ferramentas sob restrições conjuntas, enquanto a execução de ferramentas e a conformidade com o esquema permanecem funcionais quando avaliadas independentemente. Análises adicionais revelam que as restrições de Esquema JSON são compiladas em máscaras de tokens baseadas em gramática, fazendo com que tokens de chamada de ferramenta se tornem inalcançáveis durante a decodificação. Isso fornece uma explicação em nível de implementação para o comportamento observado. Para interpretar o fenômeno, formulamos a hipótese de Inversão de Prioridade de Restrição (CPI), que sugere que a satisfação do esquema pode dominar o comportamento de seleção de ação sob múltiplas restrições simultâneas. Apresentamos a CPI como uma hipótese comportamental consistente com as evidências observadas, e não como um mecanismo interno verificado. Para mitigar o problema, propomos a Execução Transparente em Duas Passagens, uma estratégia em tempo de inferência que desacopla a execução de ferramentas da geração de respostas restritas por esquema. Resultados experimentais mostram que essa abordagem restaura a invocação de ferramentas enquanto preserva as garantias de saída estruturada, sem necessidade de retreinamento do modelo. Essas descobertas sugerem que avaliar o uso de ferramentas e a saída estruturada separadamente pode negligenciar problemas importantes de confiabilidade em sistemas Agente de produção. Código, dados e documentação serão disponibilizados em https://github.com/Fzsama/Constrain-Tax-26-06.git.
English
Tool Calling and Structured Output are two core capabilities of modern Agent systems, yet their interaction under joint deployment conditions remains insufficiently understood. This paper reports a reproducible phenomenon observed in a production Agent system: when Tool Calling and JSON Schema constraints are simultaneously enabled, multiple open-weight models cease invoking tools despite maintaining high schema compliance. We refer to this behavior as Tool Suppression. Through controlled experiments across multiple model families and deployment settings, we consistently reproduce Tool Suppression under joint constraints, while tool execution and schema compliance remain functional when evaluated independently. Further analysis reveals that JSON Schema constraints are compiled into grammar-based token masks, causing tool-call tokens to become unreachable during decoding. This provides an implementation-level explanation for the observed behavior. To interpret the phenomenon, we formulate the Constraint Priority Inversion (CPI) hypothesis, which suggests that schema satisfaction may dominate action-selection behavior under multiple simultaneous constraints. We present CPI as a behavioral hypothesis consistent with the observed evidence rather than a verified internal mechanism. To mitigate the problem, we propose Transparent Two-Pass Execution, an inference-time strategy that decouples tool execution from schema-constrained response generation. Experimental results show that this approach restores tool invocation while preserving structured output guarantees without requiring model retraining. These findings suggest that evaluating tool use and structured output separately may overlook important reliability issues in production Agent systems. Code, data, and docs will be released at https://github.com/Fzsama/Constrain-Tax-26-06.git.