EdgeBench: Desvendando as Leis de Escala do Aprendizado em Ambientes Reais
EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments
July 6, 2026
Autores: Deyao Zhu, Xin Zhou, Shengling Qin, Xuekai Zhu, Hangliang Ding, Shu Zhong, Zixin Wen, Zhonglin Xie, Chenhui Gou, Linxuan Ren, Yueyang Wang, Junfeng Zhong, Rui Liu, Tian Gao, Yangguang Lin, Jingyuan Zhang, Maojia Song, Xuan Qi, Jinhong Wu, Chenyang Zhang, Yinzhu Piao, Ziru Niu, Hongbin Lin, Lingxiang Meng, Peng Tang, Chengyao Tang, Shanyu Wu, Huanyu Zheng, Yu Liu, Liya Zhu, He Wang, Ming Ding, Ziyu Wan, Hao Liu, Sibo Wang, Haotian Zhu, Xintian Zhang, Nan Chai, Yipeng Liu, Panhao Lai, Sihang Yuan, Zixin Su, Ge Zhang, Wangchunshu Zhou, Yantao Du, Wenhao Huang, Guang Shi
cs.AI
Resumo
As leis de escala de pré-treinamento revelam que a capacidade do modelo melhora de forma previsível com dados e computação. No entanto, o aprendizado a partir de ambientes reais após a implantação ainda é muito menos compreendido. Analisando aproximadamente 38.000 horas de interação de agentes com o ambiente em 134 tarefas do mundo real, encontramos, até onde sabemos, a primeira evidência de que o desempenho geral durante o aprendizado ambiental segue uma lei de escala log-sigmoidal com precisão notavelmente alta, atingindo R² = 0,998. Entre gerações de modelos, também descobrimos que a velocidade de aprendizado do agente aproximadamente duplica a cada três meses. Essa descoberta decorre do EdgeBench, um conjunto de 134 tarefas do mundo real com horizontes ultra-longos, abrangendo descoberta científica, engenharia de software, otimização combinatória, trabalho de conhecimento profissional, matemática formal e jogos interativos. Cada tarefa sustenta pelo menos 12 horas de operação contínua do agente sob feedback rico e multinível, sendo construída com esforço substancial de especialistas. Disponibilizamos publicamente 51 tarefas e nossa estrutura de avaliação completa para acelerar o estudo de como os agentes aprendem com a experiência do mundo real.
English
Pretraining scaling laws reveal that model capability improves predictably with data and compute. But learning from real world environments after deployment remains far less understood. Analyzing roughly 38,000 hours of agent interaction with the environment across 134 real world tasks, we find, to the best of our knowledge, the first evidence that overall performance during environment learning follows a log-sigmoid scaling law with remarkably high precision, reaching R^2 = 0.998. Across model generations, we also find that agent learning speed roughly doubles every three months. This discovery stems from EdgeBench, a suite of 134 real world tasks with ultra-long horizons, spanning scientific discovery, software engineering, combinatorial optimization, professional knowledge work, formal mathematics, and interactive games. Each task sustains at least 12 hours of continuous agent operation under rich, multilevel feedback, and is built through substantial expert effort. We publicly release 51 tasks and our full evaluation framework to accelerate the study of how agents learn from real world experience.