ChatPaper.aiChatPaper

AutoLLMResearch: treinando agentes de pesquisa para automatizar a configuração de experimentos LLM — aprendendo com o barato, otimizando o caro

AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration -- Learning from Cheap, Optimizing Expensive

May 12, 2026
Autores: Taicheng Guo, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang
cs.AI

Resumo

Configurar eficazmente experimentos escaláveis de grandes modelos de linguagem (LLMs), abrangendo design de arquitetura, ajuste de hiperparâmetros e outros aspectos, é crucial para o avanço da pesquisa em LLMs, pois escolhas de configuração inadequadas podem desperdiçar recursos computacionais substanciais e impedir que os modelos atinjam todo o seu potencial. Métodos automatizados anteriores são projetados para cenários de baixo custo, onde tentativa e erro repetidos são viáveis, mas experimentos escaláveis de LLMs são caros demais para iterações tão extensas. Até onde sabemos, nenhum trabalho abordou a automação de configurações de experimentos de LLMs de alto custo, deixando esse problema intensivo em mão de obra e dependente da intuição de especialistas. Motivados por essa lacuna, propomos o AutoLLMResearch, um framework baseado em agentes que imita como pesquisadores humanos aprendem princípios generalizáveis a partir de experimentos de baixa fidelidade e extrapolam para identificar eficientemente configurações promissoras em ambientes caros de LLMs. O desafio central é como capacitar um agente a aprender, por meio da interação com um ambiente experimental multifidelidade que captura a estrutura do panorama de configuração de LLMs. Para isso, propomos um framework sistemático com dois componentes principais: 1) LLMConfig-Gym, um ambiente multifidelidade que abrange quatro tarefas críticas de experimentos com LLMs, apoiado por mais de um milhão de horas de GPU de resultados experimentais verificáveis; 2) Um pipeline de treinamento estruturado que formula a pesquisa de configuração como um Processo de Decisão Markoviano de longo horizonte e, consequentemente, incentiva o raciocínio de extrapolação entre diferentes fidelidades. Uma avaliação extensa contra diversas linhas de base robustas em experimentos retidos demonstra a eficácia, generalização e interpretabilidade do nosso framework, apoiando seu potencial como uma solução prática e geral para a automação escalável de experimentos com LLMs no mundo real.
English
Effectively configuring scalable large language model (LLM) experiments, spanning architecture design, hyperparameter tuning, and beyond, is crucial for advancing LLM research, as poor configuration choices can waste substantial computational resources and prevent models from realizing their full potential. Prior automated methods are designed for low-cost settings where repeated trial and error is feasible, but scalable LLM experiments are too expensive for such extensive iteration. To our knowledge, no work has addressed the automation of high-cost LLM experiment configurations, leaving this problem labor-intensive and dependent on expert intuition. Motivated by this gap, we propose AutoLLMResearch, an agentic framework that mimics how human researchers learn generalizable principles from low-fidelity experiments and extrapolate to efficiently identify promising configurations in expensive LLM settings. The core challenge is how to enable an agent to learn, through interaction with a multi-fidelity experimental environment that captures the structure of the LLM configuration landscape. To achieve this, we propose a systematic framework with two key components: 1) LLMConfig-Gym, a multi-fidelity environment encompassing four critical LLM experiment tasks, supported by over one million GPU hours of verifiable experiment outcomes; 2) A structured training pipeline that formulates configuration research as a long-horizon Markov Decision Process and accordingly incentivizes cross-fidelity extrapolation reasoning. Extensive evaluation against diverse strong baselines on held-out experiments demonstrates the effectiveness, generalization, and interpretability of our framework, supporting its potential as a practical and general solution for scalable real-world LLM experiment automation.