Большие языковые модели, оркестрирующие структурированное мышление, достигают уровня Грандмастера на платформе Kaggle.Large Language Models Orchestrating Structured Reasoning Achieve Kaggle
Grandmaster Level
Мы представляем Агента К v1.0, полностью автономного агента по науке о данных, разработанного для автоматизации, оптимизации и обобщения различных задач науки о данных. Полностью автоматизированный Агент К v1.0 управляет всем жизненным циклом науки о данных, обучаясь на опыте. Он использует высоко гибкий структурированный каркас рассуждений, позволяющий ему динамически обрабатывать память во вложенной структуре, эффективно учась на накопленном опыте для решения сложных задач рассуждения. Он оптимизирует долговременную и кратковременную память, выборочно сохраняя и извлекая ключевую информацию, направляя будущие решения на основе окружающих вознаграждений. Этот итеративный подход позволяет ему улучшать решения без тонкой настройки или обратного распространения ошибки, достигая непрерывного улучшения через опытное обучение. Мы оцениваем возможности нашего агента, используя соревнования Kaggle в качестве кейс-стади. Следуя полностью автоматизированному протоколу, Агент К v1.0 систематически решает сложные и мультимодальные задачи науки о данных, используя байесовскую оптимизацию для настройки гиперпараметров и инженерии признаков. Наша новая система оценки строго оценивает конечные возможности Агента К v1.0 по генерации и отправке представлений, начиная с URL-адреса соревнования Kaggle. Результаты показывают, что Агент К v1.0 достигает успешности на уровне 92,5\% по всем задачам, охватывая табличные данные, компьютерное зрение, NLP и мультимодальные области. При сравнении с 5 856 участниками Kaggle с помощью расчета рейтингов Elo-MMR для каждого, Агент К v1.0 занимает место в топ-38\%, демонстрируя общий уровень навыков, сопоставимый с уровнем экспертов. Заметно, что его рейтинг Elo-MMR находится между первым и третьим квартилями рейтингов, достигнутых человеческими Гроссмейстерами. Более того, наши результаты показывают, что Агент К v1.0 достиг уровня производительности, эквивалентного Гроссмейстеру Kaggle, имея в своем активе 6 золотых, 3 серебряных и 7 бронзовых медалей, согласно системе прогрессирования Kaggle.