Long-Horizon-Terminal-Bench: проверка пределов агентов на долгосрочных терминальных задачах с оценкой на основе плотного вознаграждения
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
July 9, 2026
Авторы: Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, LeoweiLiang
cs.AI
Аннотация
AI-агенты стали способны автономно выполнять короткие, четко определенные задачи. Однако существующие терминальные бенчмарки в основном сосредоточены на простых задачах, которые занимают минуты и оцениваются только по конечному результату. Такой подход упускает из виду промежуточный прогресс и частичные решения, давая разреженные сигналы награды и неполную картину возможностей агента. Мы представляем Long-Horizon-Terminal-Bench — терминальный бенчмарк из 46 задач на длинные горизонты, охватывающий девять категорий, включая воспроизведение экспериментов, программную инженерию, мультимодальный анализ, интерактивные игры и научные вычисления. Каждая задача имеет структуру, аналогичную Terminal-Bench, с эталонным решением или симуляционным движком, но дополнительно декомпозируется на детализированные градуированные подзадачи. Такая конструкция обеспечивает плотные промежуточные награды и частичный кредит, позволяя оценке учитывать не только то, достиг ли агент конечной цели, но и насколько далеко он продвинулся в открытых рабочих процессах. Задачи в Long-Horizon-Terminal-Bench обычно требуют сотен эпизодов и от нескольких минут до часов выполнения, что делает акцент на долгосрочном планировании, управлении длинным контекстом и итеративной отладке, а не на одноразовом решении задач. Мы оцениваем 15 передовых моделей и обнаруживаем, что агенты в среднем потребляют 9,9 млн токенов на задачу, примерно 231 эпизод и 85,3 минуты на выполнение одного запуска, что делает Long-Horizon-Terminal-Bench более требовательным, чем предыдущие терминальные бенчмарки. Даже самая сильная из протестированных моделей достигает 15,2% pass@1 при пороге частичного вознаграждения 0,95 и 10,9% при пороге идеального вознаграждения 1,0, тогда как средний показатель успеха по всем моделям составляет 4,3% и 1,7% при этих двух порогах соответственно. Эти результаты указывают на значительный потенциал для улучшения. Мы дополнительно анализируем режимы отказов и типичные ошибки и публикуем Long-Horizon-Terminal-Bench для поддержки будущих достижений в области терминальных агентов с длинным горизонтом.
English
AI agents have become capable of autonomously completing short, well-specified tasks. However, existing terminal benchmarks largely focus on simple problems that finish within minutes and are evaluated only by their final outcome. This setup overlooks intermediate progress and partial solutions, yielding sparse reward signals and an incomplete picture of agent capability. We introduce Long-Horizon-Terminal-Bench, a terminal benchmark of 46 long-horizon tasks spanning nine categories, including experiment reproduction, software engineering, multimodal analysis, interactive games, and scientific computing. Each task follows a Terminal-Bench-style setup with a reference solution or simulation engine, but is further decomposed into fine-grained graded subtasks. This design enables dense intermediate rewards and partial credit, allowing evaluation to capture not only whether an agent reaches the final goal, but also how far it progresses on open-ended workflows. Tasks in Long-Horizon-Terminal-Bench typically require hundreds of episodes and minutes to hours of execution, stressing long-horizon planning, long-context management, and iterative debugging rather than one-shot problem solving. We evaluate 15 frontier models and find that agents consume on average 9.9M tokens per task, with roughly 231 episodes and 85.3 minutes of execution time per run, making Long-Horizon-Terminal-Bench more demanding than prior terminal-based benchmarks. Even the strongest tested model achieves 15.2% pass@1 at a partial-reward threshold of 0.95 and 10.9% at a perfect-reward threshold of 1.0, while the mean pass rate across models is 4.3% and 1.7% under the two thresholds, respectively. These results reveal headroom for improvement. We further analyze failure modes and error patterns, and release Long-Horizon-Terminal-Bench to support future progress on long-horizon terminal agents.