PlanBench-XL: Avaliação do Planejamento de Longo Horizonte de Agentes de Uso de Ferramentas de LLM em Ecossistemas de Ferramentas em Grande Escala
PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems
June 21, 2026
Autores: Jiayu Liu, Qihan Lin, Cheng Qian, Rui Wang, Emre Can Acikgoz, Xiaocheng Yang, Jiateng Liu, Zhenhailong Wang, Xiusi Chen, Heng Ji, Dilek Hakkani-Tür
cs.AI
Resumo
Agentes LLM operam cada vez mais em grandes ecossistemas de ferramentas, onde tarefas do mundo real exigem descobrir ferramentas relevantes, inferir subobjetivos implícitos e adaptar-se a ambientes dinâmicos ao longo de horizontes temporais extensos. No entanto, benchmarks existentes raramente avaliam o planejamento sob visibilidade limitada de ferramentas por recuperação. Para preencher essa lacuna, introduzimos o PlanBench-XL, um benchmark interativo composto por 327 tarefas de varejo sobre 1.665 ferramentas, que testa se os agentes conseguem recuperar iterativamente ferramentas utilizáveis, acioná-las para descobrir evidências intermediárias para chamadas subsequentes em direção ao objetivo final. O PlanBench-XL também incorpora um mecanismo opcional de bloqueio que simula a imprevisibilidade do mundo real por meio de funções de ferramentas ausentes, falhas ou distractoras, forçando os agentes a detectar caminhos interrompidos e se adaptar em tempo de execução. Experimentos com dez LLMs líderes mostram que o planejamento com grande quantidade de ferramentas continua desafiador: enquanto o GPT-5.4 atinge 51,90% de precisão em cenários sem bloqueio, seu desempenho cai para 11,36% sob a condição de bloqueio mais severa. Análises adicionais revelam que os agentes são especialmente vulneráveis quando as falhas carecem de sinais de erro explícitos ou quando a recuperação exige caminhos alternativos mais longos de uso de ferramentas. Esses resultados estabelecem o PlanBench-XL como um ambiente de teste para diagnosticar falhas de planejamento agentivo e destacam a necessidade de planejamento adaptativo robusto em tarefas de longo horizonte com grandes ambientes de ferramentas imperfeitas.
English
LLM agents increasingly operate in large tool ecosystems, where real-world tasks require discovering relevant tools, inferring implicit sub-goals, and adapting to dynamic environments over long horizons. However, existing benchmarks rarely evaluate planning under retrieval-limited tool visibility. To address this gap, we introduce PlanBench-XL, an interactive benchmark of 327 retail tasks over 1,665 tools that tests whether agents can iteratively retrieve usable tools, invoke them to uncover intermediate evidence for subsequent calls toward the final goal. PlanBench-XL further features an optional blocking mechanism that simulates real-world unpredictability through missing, failing, or distracting tool functions, forcing agents to detect disrupted paths and adapt at runtime. Experiments on ten leading LLMs show that massive-tool planning remains challenging: while GPT-5.4 achieves 51.90% accuracy in block-free settings, it collapses to 11.36% under the most severe blocking condition. Further analysis shows that agents are especially vulnerable when failures lack explicit error signals or when recovery requires longer alternative tool-use paths. These results establish PlanBench-XL as a testbed for diagnosing agentic planning failures and highlight the need for robust adaptive planning in long-horizon tasks with large, imperfect tool environments.