Por que o Aprendizado por Reforço de Uso de Ferramentas em Múltiplas Etapas Colapsa e Como Sinais de Supervisão o Corrigem
Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It
June 24, 2026
Autores: Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao
cs.AI
Resumo
O uso de ferramentas permite que modelos de linguagem de grande escala (LLMs) realizem tarefas complexas, e métodos recentes de aprendizado por reforço (RL) agentivo mostram potencial para aprimorar as capacidades dos modelos. No entanto, o RL isolado frequentemente leva a instabilidade ou ganhos limitados em tarefas de uso de ferramentas. Em nossos experimentos, alguns modelos exibem colapso catastrófico, onde o desempenho cai abruptamente e as estruturas de invocação de ferramentas falham. A análise revela que essas falhas decorrem de picos inesperados de probabilidade em tokens de controle específicos, interrompendo a execução estruturada, embora a capacidade subjacente de uso de ferramentas permaneça intacta, apenas obscurecida por formatos específicos. Para lidar com isso, investigamos sistematicamente um conjunto diverso de sinais de supervisão, incluindo supervisão off-policy, orientação baseada em dicas, supervisão com exemplos errôneos e outros, aplicados tanto em esquemas de treinamento síncrono quanto intercalado. Descobrimos que intercalar fine-tuning supervisionado (SFT) com RL melhora substancialmente a estabilidade, mas apresenta desempenho degradado sob avaliação for a de distribuição (OOD) de formato e conteúdo. Também analisamos o impacto das taxas de aprendizado e a generalização entre cenários. Esses resultados destacam a importância de compreender as falhas do RL e demonstram como diversos sinais de supervisão podem guiar o aprendizado exploratório, permitindo o treinamento robusto de LLMs para tarefas complexas de uso de ferramentas com múltiplas etapas. Nosso código está disponível em https://github.com/hypasd-art/Tool-RL-Box.
English
Tool use enables large language models (LLMs) to perform complex tasks, and recent agentic reinforcement learning (RL) methods show promise for enhancing model capabilities. However, RL alone often leads to instability or limited gains in tool-use tasks. In our experiments, some models exhibit catastrophic collapse, where performance abruptly drops and tool-invocation structures fail. The analysis reveals that these failures stem from unexpected probability spikes in specific control tokens, disrupting structured execution, yet the underlying tool-use capability remains intact, merely obscured by specific formats. To address this, we systematically investigate a diverse set of supervisory signals, including off-policy supervision, hint-based guidance, erroneous example supervision, and others, applied under both synchronous and interleaved training schemes. We find that interleaving supervised fine-tuning (SFT) with RL substantially improves stability, but exhibits degraded performance under format and content out-of-distribution (OOD) evaluation. We also analyze the impact of learning rates and generalization across settings. These results highlight the importance of understanding RL failures and demonstrate how diverse supervisory signals can guide exploratory learning, enabling robust training of LLMs for complex, multi-step tool-use tasks. Our Code is available at https://github.com/hypasd-art/Tool-RL-Box.