ChatPaper.aiChatPaper

GTA-2 : Évaluation comparative des agents-outils généralistes, de l'utilisation atomique d'outils aux flux de travail ouverts

GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows

April 17, 2026
Auteurs: Jize Wang, Xuanxuan Liu, Yining Li, Songyang Zhang, Yijun Wang, Zifei Shan, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao
cs.AI

Résumé

Le développement d'agents polyvalents nécessite une transition de l'exécution d'instructions simples vers l'accomplissement de flux de travail productifs complexes et réalistes. Cependant, les benchmarks actuels sur l'utilisation d'outils restent mal alignés avec les exigences du monde réel, reposant sur des requêtes générées par IA, des outils factices et une coordination limitée au niveau système. Pour y remédier, nous proposons GTA-2, un benchmark hiérarchique pour Agents à Outils Généraux (GTA) couvrant l'utilisation atomique d'outils et les flux de travail ouverts. Fondé sur l'authenticité du monde réel, il s'appuie sur des requêtes utilisateur réelles, des outils déployés et des contextes multimodaux. (i) GTA-Atomic, hérité de notre benchmark GTA antérieur, évalue la précision d'utilisation d'outils fermés à court terme. (ii) GTA-Workflow introduit des tâches ouvertes à long terme pour une réalisation réaliste de bout en bout. Pour évaluer les livrables ouverts, nous proposons un mécanisme d'évaluation récursif basé sur des points de contrôle qui décompose les objectifs en sous-objectifs vérifiables, permettant une évaluation unifiée des capacités des modèles et des cadres d'exécution des agents (c'est-à-dire, les harnais d'exécution). Les expériences révèlent un effondrement prononcé des capacités : alors que les modèles de pointe peinent déjà sur les tâches atomiques (moins de 50 %), ils échouent largement sur les flux de travail, les meilleurs modèles n'atteignant que 14,39 % de succès. Une analyse plus poussée montre que le retour d'information guidé par points de contrôle améliore les performances, tandis que des cadres avancés tels que Manus et OpenClaw améliorent substantiellement l'achèvement des flux de travail, soulignant l'importance de la conception du harnais d'exécution au-delà de la capacité du modèle sous-jacent. Ces résultats fournissent des orientations pour développer des assistants personnels et professionnels fiables. Le jeu de données et le code seront disponibles à l'adresse https://github.com/open-compass/GTA.
English
The development of general-purpose agents requires a shift from executing simple instructions to completing complex, real-world productivity workflows. However, current tool-use benchmarks remain misaligned with real-world requirements, relying on AI-generated queries, dummy tools, and limited system-level coordination. To address this, we propose GTA-2, a hierarchical benchmark for General Tool Agents (GTA) spanning atomic tool use and open-ended workflows. Built on real-world authenticity, it leverages real user queries, deployed tools, and multimodal contexts. (i) GTA-Atomic, inherited from our prior GTA benchmark, evaluates short-horizon, closed-ended tool-use precision. (ii) GTA-Workflow introduces long-horizon, open-ended tasks for realistic end-to-end completion. To evaluate open-ended deliverables, we propose a recursive checkpoint-based evaluation mechanism that decomposes objectives into verifiable sub-goals, enabling unified evaluation of both model capabilities and agent execution frameworks (i.e., execution harnesses). Experiments reveal a pronounced capability cliff: while frontier models already struggle on atomic tasks (below 50%), they largely fail on workflows, with top models achieving only 14.39% success. Further analysis shows that checkpoint-guided feedback improves performance, while advanced frameworks such as Manus and OpenClaw substantially enhance workflow completion, highlighting the importance of execution harness design beyond the underlying model capacity. These findings provide guidance for developing reliable personal and professional assistants. Dataset and code will be available at https://github.com/open-compass/GTA.