ChatPaper.aiChatPaper

AutoLab : Les modèles de pointe peuvent-ils résoudre des tâches de recherche et d'ingénierie automobile à long terme ?

AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?

June 3, 2026
Auteurs: Zhangchen Xu, Junda Chen, Yue Huang, Dongfu Jiang, Jiefeng Chen, Hang Hua, Zijian Wu, Zheyuan Liu, Zexue He, Lichi Li, Shizhe Diao, Jiaxin Pei, Jinsung Yoon, Hao Zhang, Mengdi Wang, Radha Poovendran, Misha Sra, Alex Pentland, Zichen Chen
cs.AI

Résumé

Les progrès scientifiques et techniques sont fondamentalement un processus itératif à long horizon : proposer des modifications, mener des expériences, mesurer les résultats et affiner continuellement les artefacts. Pourtant, les référentiels existants destinés aux modèles frontières évaluent principalement soit des réponses uniques, soit des trajectoires d'agents à court horizon, sans parvenir à capturer les défis d'une amélioration itérative soutenue sur des horizons temporels étendus. Pour combler cette lacune, nous présentons AutoLab, un nouveau référentiel pour l'optimisation en boucle fermée à très long horizon. AutoLab comprend 36 tâches réalistes, sélectionnées par des experts, couvrant quatre domaines variés : l'optimisation de systèmes, les casse-têtes et défis, le développement de modèles, et l'optimisation de noyaux CUDA. Chaque tâche débute avec une base de référence correcte mais délibérément sous-optimale et met les agents au défi de l'améliorer dans un budget de temps strict (temps réel). L'évaluation de 17 modèles de pointe révèle que le prédicteur dominant de succès n'est pas la qualité de la première tentative d'un agent, mais sa persistance à évaluer, éditer et intégrer de manière répétée les retours empiriques. Bien que claude-opus-4.6 démontre de fortes capacités d'optimisation à long horizon, la plupart des modèles frontières, y compris plusieurs modèles propriétaires, soit s'arrêtent prématurément, soit épuisent leurs budgets avec des progrès minimes. Ces résultats soulignent l'importance de la conscience temporelle et de l'itération persistante dans les agents autonomes. Nous publions en open source l'intégralité du référentiel, du cadre d'évaluation et des artefacts de tâches, afin d'accélérer la recherche vers des agents véritablement capables d'action à long horizon.
English
Scientific and engineering progress is fundamentally a long-horizon iterative process: proposing changes, running experiments, measuring outcomes, and continuously refining artifacts. Yet existing benchmarks for frontier models primarily evaluate either single-turn responses or short-horizon agent trajectories, failing to capture the challenges of sustained iterative improvement over extended time horizons. To address this gap, we introduce AutoLab, a new benchmark for ultra long-horizon closed-loop optimization. AutoLab consists of 36 realistic, expert-curated tasks spanning four diverse domains: system optimization, puzzle & challenge, model development, and CUDA kernel optimization. Each task begins with a correct but deliberately suboptimal baseline and challenges agents to improve it within a strict wall-clock budget. Evaluating 17 state-of-the-art models reveals the dominant predictor of success is not the quality of an agent's initial attempt, but its persistence in repeatedly benchmarking, editing, and incorporating empirical feedback. While claude-opus-4.6 exhibits strong long-horizon optimization capabilities, most frontier models, including several proprietary ones, either terminate prematurely or exhaust their budgets with minimal progress. These results underscore the importance of time awareness and persistent iteration in autonomous agents. We open-source the full benchmark, evaluation harness, and task artifacts, to accelerate research toward truly capable long-horizon agents.