ChatPaper.aiChatPaper

AutoLLMResearch: Het trainen van onderzoeksagenten voor het automatiseren van LLM-experimentconfiguratie – Leren van goedkope, optimaliseren van dure

AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration -- Learning from Cheap, Optimizing Expensive

May 12, 2026
Auteurs: Taicheng Guo, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang
cs.AI

Samenvatting

Het effectief configureren van schaalbare experimenten met grote taalmodellen (LLM's), variërend van architectuurontwerp tot hyperparameteroptimalisatie en verder, is cruciaal voor de vooruitgang van LLM-onderzoek, omdat slechte configuratiekeuzes aanzienlijke rekenbronnen kunnen verspillen en modellen kunnen beletten hun volledige potentieel te bereiken. Eerdere geautomatiseerde methoden zijn ontworpen voor goedkope omgevingen waar herhaaldelijk proberen en falen haalbaar is, maar schaalbare LLM-experimenten zijn te duur voor dergelijke uitgebreide iteratie. Voor zover wij weten, heeft geen enkel werk de automatisering van dure LLM-experimentconfiguraties aangepakt, waardoor dit probleem arbeidsintensief blijft en afhankelijk is van deskundigenintuïtie. Gemotiveerd door deze leemte stellen we AutoLLMResearch voor, een agentisch raamwerk dat nabootst hoe menselijke onderzoekers generaliseerbare principes leren van experimenten met lage betrouwbaarheid en extrapoleren om efficiënt veelbelovende configuraties in dure LLM-omgevingen te identificeren. De kernuitdaging is hoe een agent kan leren door interactie met een multi-fidelity experimentele omgeving die de structuur van het LLM-configuratielandschap vastlegt. Om dit te bereiken stellen we een systematisch raamwerk voor met twee belangrijke componenten: 1) LLMConfig-Gym, een multi-fidelity omgeving die vier kritieke LLM-experimenttaken omvat, ondersteund door meer dan een miljoen GPU-uren aan verifieerbare experimentresultaten; 2) Een gestructureerde trainingspijplijn die configuratieonderzoek formuleert als een Markov-beslissingsproces met lange horizon en dienovereenkomstig redeneren over cross-fidelity extrapolatie stimuleert. Uitgebreide evaluatie tegen diverse sterke baselines op uitgesloten experimenten toont de effectiviteit, generaliseerbaarheid en interpreteerbaarheid van ons raamwerk aan, wat het potentieel ondersteunt als een praktische en algemene oplossing voor schaalbare automatisering van LLM-experimenten in de echte wereld.
English
Effectively configuring scalable large language model (LLM) experiments, spanning architecture design, hyperparameter tuning, and beyond, is crucial for advancing LLM research, as poor configuration choices can waste substantial computational resources and prevent models from realizing their full potential. Prior automated methods are designed for low-cost settings where repeated trial and error is feasible, but scalable LLM experiments are too expensive for such extensive iteration. To our knowledge, no work has addressed the automation of high-cost LLM experiment configurations, leaving this problem labor-intensive and dependent on expert intuition. Motivated by this gap, we propose AutoLLMResearch, an agentic framework that mimics how human researchers learn generalizable principles from low-fidelity experiments and extrapolate to efficiently identify promising configurations in expensive LLM settings. The core challenge is how to enable an agent to learn, through interaction with a multi-fidelity experimental environment that captures the structure of the LLM configuration landscape. To achieve this, we propose a systematic framework with two key components: 1) LLMConfig-Gym, a multi-fidelity environment encompassing four critical LLM experiment tasks, supported by over one million GPU hours of verifiable experiment outcomes; 2) A structured training pipeline that formulates configuration research as a long-horizon Markov Decision Process and accordingly incentivizes cross-fidelity extrapolation reasoning. Extensive evaluation against diverse strong baselines on held-out experiments demonstrates the effectiveness, generalization, and interpretability of our framework, supporting its potential as a practical and general solution for scalable real-world LLM experiment automation.