EdgeBench : Dévoiler les lois d'échelle de l'apprentissage à partir d'environnements réels
EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments
July 6, 2026
Auteurs: Deyao Zhu, Xin Zhou, Shengling Qin, Xuekai Zhu, Hangliang Ding, Shu Zhong, Zixin Wen, Zhonglin Xie, Chenhui Gou, Linxuan Ren, Yueyang Wang, Junfeng Zhong, Rui Liu, Tian Gao, Yangguang Lin, Jingyuan Zhang, Maojia Song, Xuan Qi, Jinhong Wu, Chenyang Zhang, Yinzhu Piao, Ziru Niu, Hongbin Lin, Lingxiang Meng, Peng Tang, Chengyao Tang, Shanyu Wu, Huanyu Zheng, Yu Liu, Liya Zhu, He Wang, Ming Ding, Ziyu Wan, Hao Liu, Sibo Wang, Haotian Zhu, Xintian Zhang, Nan Chai, Yipeng Liu, Panhao Lai, Sihang Yuan, Zixin Su, Ge Zhang, Wangchunshu Zhou, Yantao Du, Wenhao Huang, Guang Shi
cs.AI
Résumé
Les lois d'échelle du pré-entraînement montrent que la capacité des modèles s'améliore de manière prévisible avec les données et la puissance de calcul. Cependant, l'apprentissage à partir d'environnements réels après le déploiement reste bien moins compris. En analysant environ 38 000 heures d'interaction d'un agent avec l'environnement à travers 134 tâches du monde réel, nous trouvons, à notre connaissance, la première preuve que la performance globale durant l'apprentissage environnemental suit une loi d'échelle log-sigmoïde avec une précision remarquablement élevée, atteignant un R² = 0,998. À travers les générations de modèles, nous observons également que la vitesse d'apprentissage de l'agent double environ tous les trois mois. Cette découverte provient d'EdgeBench, un ensemble de 134 tâches du monde réel aux horizons ultra-longs, couvrant la découverte scientifique, le génie logiciel, l'optimisation combinatoire, le travail de connaissance professionnelle, les mathématiques formelles et les jeux interactifs. Chaque tâche soutient au moins 12 heures d'opération continue de l'agent sous un retour riche et multi-niveaux, et est construite grâce à un effort expert considérable. Nous publions publiquement 51 tâches ainsi que notre cadre d'évaluation complet afin d'accélérer l'étude de la manière dont les agents apprennent à partir de l'expérience du monde réel.
English
Pretraining scaling laws reveal that model capability improves predictably with data and compute. But learning from real world environments after deployment remains far less understood. Analyzing roughly 38,000 hours of agent interaction with the environment across 134 real world tasks, we find, to the best of our knowledge, the first evidence that overall performance during environment learning follows a log-sigmoid scaling law with remarkably high precision, reaching R^2 = 0.998. Across model generations, we also find that agent learning speed roughly doubles every three months. This discovery stems from EdgeBench, a suite of 134 real world tasks with ultra-long horizons, spanning scientific discovery, software engineering, combinatorial optimization, professional knowledge work, formal mathematics, and interactive games. Each task sustains at least 12 hours of continuous agent operation under rich, multilevel feedback, and is built through substantial expert effort. We publicly release 51 tasks and our full evaluation framework to accelerate the study of how agents learn from real world experience.