ChatPaper.aiChatPaper

Long-Horizon-Terminal-Bench: Het testen van de grenzen van agenten op lange-horizon terminale taken met beoordeling op basis van dichte beloningen

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

July 9, 2026
Auteurs: Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, LeoweiLiang
cs.AI

Samenvatting

AI-agenten zijn in staat geworden om autonoom korte, goed gespecificeerde taken uit te voeren. Bestaande terminalbenchmarks richten zich echter grotendeels op eenvoudige problemen die binnen enkele minuten worden afgerond en alleen op hun eindresultaat worden geëvalueerd. Deze opzet gaat voorbij aan tussentijdse voortgang en gedeeltelijke oplossingen, wat leidt tot spaarzame beloningssignalen en een onvolledig beeld van de capaciteiten van de agent. Wij introduceren Long-Horizon-Terminal-Bench, een terminalbenchmark van 46 taken met een lange horizon over negen categorieën, waaronder experimentreproductie, software-engineering, multimodale analyse, interactieve spellen en wetenschappelijk rekenen. Elke taak volgt een Terminal-Bench-achtige opzet met een referentieoplossing of simulatie-engine, maar wordt verder opgesplitst in fijnmazige, gegradeerde deeltaken. Dit ontwerp maakt dichte tussentijdse beloningen en gedeeltelijke scores mogelijk, waardoor de evaluatie niet alleen kan vaststellen of een agent het einddoel bereikt, maar ook hoe ver hij vordert in open-eindworkflows. Taken in Long-Horizon-Terminal-Bench vereisen typisch honderden episodes en minuten tot uren uitvoeringstijd, waarbij de nadruk ligt op planning over een lange horizon, beheer van lange contexten en iteratief debuggen in plaats van eenmalig probleemoplossen. Wij evalueren 15 frontier-modellen en constateren dat agenten gemiddeld 9,9 miljoen tokens per taak verbruiken, met ongeveer 231 episodes en 85,3 minuten uitvoeringstijd per run, wat Long-Horizon-Terminal-Bench veeleisender maakt dan eerdere terminalgebaseerde benchmarks. Zelfs het sterkst geteste model behaalt 15,2% pass@1 bij een drempel voor gedeeltelijke beloning van 0,95 en 10,9% bij een drempel voor perfecte beloning van 1,0, terwijl de gemiddelde slaagkans over modellen respectievelijk 4,3% en 1,7% is onder de twee drempels. Deze resultaten tonen ruimte voor verbetering. Wij analyseren verder faalmodi en foutpatronen, en stellen Long-Horizon-Terminal-Bench beschikbaar om toekomstige vooruitgang op het gebied van terminalagenten met een lange horizon te ondersteunen.
English
AI agents have become capable of autonomously completing short, well-specified tasks. However, existing terminal benchmarks largely focus on simple problems that finish within minutes and are evaluated only by their final outcome. This setup overlooks intermediate progress and partial solutions, yielding sparse reward signals and an incomplete picture of agent capability. We introduce Long-Horizon-Terminal-Bench, a terminal benchmark of 46 long-horizon tasks spanning nine categories, including experiment reproduction, software engineering, multimodal analysis, interactive games, and scientific computing. Each task follows a Terminal-Bench-style setup with a reference solution or simulation engine, but is further decomposed into fine-grained graded subtasks. This design enables dense intermediate rewards and partial credit, allowing evaluation to capture not only whether an agent reaches the final goal, but also how far it progresses on open-ended workflows. Tasks in Long-Horizon-Terminal-Bench typically require hundreds of episodes and minutes to hours of execution, stressing long-horizon planning, long-context management, and iterative debugging rather than one-shot problem solving. We evaluate 15 frontier models and find that agents consume on average 9.9M tokens per task, with roughly 231 episodes and 85.3 minutes of execution time per run, making Long-Horizon-Terminal-Bench more demanding than prior terminal-based benchmarks. Even the strongest tested model achieves 15.2% pass@1 at a partial-reward threshold of 0.95 and 10.9% at a perfect-reward threshold of 1.0, while the mean pass rate across models is 4.3% and 1.7% under the two thresholds, respectively. These results reveal headroom for improvement. We further analyze failure modes and error patterns, and release Long-Horizon-Terminal-Bench to support future progress on long-horizon terminal agents.