Long-Horizon-Terminal-Bench : Tester les limites des agents sur des tâches terminales à long horizon avec une notation basée sur des récompenses denses.

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

July 9, 2026
Auteurs: Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, LeoweiLiang
cs.AI

Résumé

Les agents d'IA sont désormais capables d'achever de manière autonome des tâches courtes et bien spécifiées. Cependant, les benchmarks terminaux existants se concentrent en grande partie sur des problèmes simples qui se terminent en quelques minutes et ne sont évalués que sur la base de leur résultat final. Cette configuration néglige la progression intermédiaire et les solutions partielles, produisant des signaux de récompense parcimonieux et une image incomplète des capacités des agents. Nous introduisons Long-Horizon-Terminal-Bench, un benchmark terminal de 46 tâches à long horizon couvrant neuf catégories, incluant la reproduction d'expériences, le génie logiciel, l'analyse multimodale, les jeux interactifs et le calcul scientifique. Chaque tâche suit une configuration de type Terminal-Bench avec une solution de référence ou un moteur de simulation, mais est en outre décomposée en sous-tâches graduées finement. Cette conception permet d'obtenir des récompenses intermédiaires denses et un crédit partiel, permettant à l'évaluation de capturer non seulement si un agent atteint l'objectif final, mais aussi jusqu'où il progresse dans des workflows ouverts. Les tâches de Long-Horizon-Terminal-Bench nécessitent typiquement des centaines d'épisodes et de quelques minutes à plusieurs heures d'exécution, mettant l'accent sur la planification à long horizon, la gestion de contexte long et le débogage itératif plutôt que sur la résolution unique de problèmes. Nous évaluons 15 modèles de pointe et constatons que les agents consomment en moyenne 9,9 millions de tokens par tâche, avec environ 231 épisodes et 85,3 minutes de temps d'exécution par passage, ce qui rend Long-Horizon-Terminal-Bench plus exigeant que les benchmarks terminaux précédents. Même le modèle testé le plus performant atteint un taux de réussite au premier essai (pass@1) de 15,2 % pour un seuil de récompense partielle de 0,95 et de 10,9 % pour un seuil de récompense parfaite de 1,0, tandis que le taux de réussite moyen pour l'ensemble des modèles est respectivement de 4,3 % et 1,7 % sous ces deux seuils. Ces résultats révèlent une marge de progression importante. Nous analysons en outre les modes d'échec et les schémas d'erreur, et publions Long-Horizon-Terminal-Bench pour soutenir les futurs progrès sur les agents terminaux à long horizon.
English
AI agents have become capable of autonomously completing short, well-specified tasks. However, existing terminal benchmarks largely focus on simple problems that finish within minutes and are evaluated only by their final outcome. This setup overlooks intermediate progress and partial solutions, yielding sparse reward signals and an incomplete picture of agent capability. We introduce Long-Horizon-Terminal-Bench, a terminal benchmark of 46 long-horizon tasks spanning nine categories, including experiment reproduction, software engineering, multimodal analysis, interactive games, and scientific computing. Each task follows a Terminal-Bench-style setup with a reference solution or simulation engine, but is further decomposed into fine-grained graded subtasks. This design enables dense intermediate rewards and partial credit, allowing evaluation to capture not only whether an agent reaches the final goal, but also how far it progresses on open-ended workflows. Tasks in Long-Horizon-Terminal-Bench typically require hundreds of episodes and minutes to hours of execution, stressing long-horizon planning, long-context management, and iterative debugging rather than one-shot problem solving. We evaluate 15 frontier models and find that agents consume on average 9.9M tokens per task, with roughly 231 episodes and 85.3 minutes of execution time per run, making Long-Horizon-Terminal-Bench more demanding than prior terminal-based benchmarks. Even the strongest tested model achieves 15.2% pass@1 at a partial-reward threshold of 0.95 and 10.9% at a perfect-reward threshold of 1.0, while the mean pass rate across models is 4.3% and 1.7% under the two thresholds, respectively. These results reveal headroom for improvement. We further analyze failure modes and error patterns, and release Long-Horizon-Terminal-Bench to support future progress on long-horizon terminal agents.
PDF461July 14, 2026