La Course des Agents Étonnants : Maîtres des Outils, Faibles Navigateurs
The Amazing Agent Race: Strong Tool Users, Weak Navigators
April 17, 2026
Auteurs: Zae Myung Kim, Dongseok Lee, Jaehyung Kim, Vipul Raheja, Dongyeop Kang
cs.AI
Résumé
Les bancs d'essai existants sur l'utilisation d'outils par les agents LLM sont massivement linéaires : notre analyse de six benchmarks révèle que 55 à 100 % des instances sont de simples chaînes de 2 à 5 étapes. Nous présentons The Amazing Agent Race (AAR), un benchmark comportant des puzzles en graphe acyclique orienté (ou « étapes ») avec des chaînes d'outils à embranchements et fusions. Nous publions 1 400 instances réparties en deux variantes : séquentielle (800 étapes) et compositionnelle (600 étapes en graphe). Les agents doivent naviguer sur Wikipédia, exécuter des chaînes d'outils multi-étapes et agréger les résultats en une réponse vérifiable. Les étapes sont générées procéduralement à partir de sources Wikipédia sur quatre niveaux de difficulté, avec validation en temps réel par API. Trois métriques complémentaires (précision à l'arrivée, taux de passage aux ravitaillements et taux de franchissement des obstacles) diagnostiquent respectivement les échecs de navigation, d'utilisation d'outils et de calcul. L'évaluation de trois frameworks d'agents sur 1 400 étapes montre que le meilleur n'atteint que 37,2 % de précision. Les erreurs de navigation dominent (27 à 52 % des essais) tandis que les erreurs d'utilisation d'outils restent inférieures à 17 %, et l'architecture de l'agent compte autant que la taille du modèle (Claude Code égalise Codex CLI à 37 % avec 6 fois moins de tokens). La structure compositionnelle d'AAR révèle que les agents échouent non pas à appeler des outils, mais à naviguer vers les bonnes pages, un angle mort invisible pour les benchmarks linéaires. La page du projet est accessible à l'adresse : https://minnesotanlp.github.io/the-amazing-agent-race
English
Existing tool-use benchmarks for LLM agents are overwhelmingly linear: our analysis of six benchmarks shows 55 to 100% of instances are simple chains of 2 to 5 steps. We introduce The Amazing Agent Race (AAR), a benchmark featuring directed acyclic graph (DAG) puzzles (or "legs") with fork-merge tool chains. We release 1,400 instances across two variants: sequential (800 legs) and compositional (600 DAG legs). Agents must navigate Wikipedia, execute multi-step tool chains, and aggregate results into a verifiable answer. Legs are procedurally generated from Wikipedia seeds across four difficulty levels with live-API validation. Three complementary metrics (finish-line accuracy, pit-stop visit rate, and roadblock completion rate) separately diagnose navigation, tool-use, and arithmetic failures. Evaluating three agent frameworks on 1,400 legs, the best achieves only 37.2% accuracy. Navigation errors dominate (27 to 52% of trials) while tool-use errors remain below 17%, and agent architecture matters as much as model scale (Claude Code matches Codex CLI at 37% with 6x fewer tokens). The compositional structure of AAR reveals that agents fail not at calling tools but at navigating to the right pages, a blind spot invisible to linear benchmarks. The project page can be accessed at: https://minnesotanlp.github.io/the-amazing-agent-race