Long-Horizon-Terminal-Bench: Probando los límites de los agentes en tareas terminales de horizonte largo con calificación basada en recompensas densas

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

July 9, 2026
Autores: Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, LeoweiLiang
cs.AI

Resumen

Los agentes de IA han adquirido la capacidad de completar de forma autónoma tareas cortas y bien especificadas. Sin embargo, los benchmarks terminales existentes se centran mayoritariamente en problemas simples que se resuelven en minutos y se evalúan únicamente por su resultado final. Esta configuración pasa por alto el progreso intermedio y las soluciones parciales, generando señales de recompensa dispersas y una imagen incompleta de la capacidad del agente. Presentamos Long-Horizon-Terminal-Bench, un benchmark terminal compuesto por 46 tareas de horizonte largo que abarcan nueve categorías, incluyendo reproducción de experimentos, ingeniería de software, análisis multimodal, juegos interactivos y computación científica. Cada tarea sigue una configuración al estilo de Terminal-Bench, con una solución de referencia o un motor de simulación, pero se descompone además en subtareas graduadas de grano fino. Este diseño permite recompensas intermedias densas y crédito parcial, de modo que la evaluación captura no solo si un agente alcanza la meta final, sino también cuánto avanza en flujos de trabajo abiertos. Las tareas en Long-Horizon-Terminal-Bench requieren típicamente cientos de episodios y minutos a horas de ejecución, poniendo énfasis en la planificación de horizonte largo, la gestión de contextos extensos y la depuración iterativa, más que en la resolución de problemas de un solo paso. Evaluamos 15 modelos de frontera y encontramos que los agentes consumen en promedio 9,9 millones de tokens por tarea, con aproximadamente 231 episodios y 85,3 minutos de tiempo de ejecución por ejecución, lo que hace que Long-Horizon-Terminal-Bench sea más exigente que los benchmarks terminales previos. Incluso el modelo más fuerte evaluado alcanza un 15,2% de pass@1 en un umbral de recompensa parcial de 0,95 y un 10,9% en un umbral de recompensa perfecta de 1,0, mientras que la tasa de aprobación media entre modelos es del 4,3% y 1,7% bajo los dos umbrales respectivamente. Estos resultados revelan un amplio margen de mejora. Adicionalmente, analizamos los modos de fallo y los patrones de error, y publicamos Long-Horizon-Terminal-Bench para apoyar el progreso futuro en agentes terminales de horizonte largo.
English
AI agents have become capable of autonomously completing short, well-specified tasks. However, existing terminal benchmarks largely focus on simple problems that finish within minutes and are evaluated only by their final outcome. This setup overlooks intermediate progress and partial solutions, yielding sparse reward signals and an incomplete picture of agent capability. We introduce Long-Horizon-Terminal-Bench, a terminal benchmark of 46 long-horizon tasks spanning nine categories, including experiment reproduction, software engineering, multimodal analysis, interactive games, and scientific computing. Each task follows a Terminal-Bench-style setup with a reference solution or simulation engine, but is further decomposed into fine-grained graded subtasks. This design enables dense intermediate rewards and partial credit, allowing evaluation to capture not only whether an agent reaches the final goal, but also how far it progresses on open-ended workflows. Tasks in Long-Horizon-Terminal-Bench typically require hundreds of episodes and minutes to hours of execution, stressing long-horizon planning, long-context management, and iterative debugging rather than one-shot problem solving. We evaluate 15 frontier models and find that agents consume on average 9.9M tokens per task, with roughly 231 episodes and 85.3 minutes of execution time per run, making Long-Horizon-Terminal-Bench more demanding than prior terminal-based benchmarks. Even the strongest tested model achieves 15.2% pass@1 at a partial-reward threshold of 0.95 and 10.9% at a perfect-reward threshold of 1.0, while the mean pass rate across models is 4.3% and 1.7% under the two thresholds, respectively. These results reveal headroom for improvement. We further analyze failure modes and error patterns, and release Long-Horizon-Terminal-Bench to support future progress on long-horizon terminal agents.
PDF461July 14, 2026