Hiërarchische Experimentele Agenten
Hierarchical Experimentalist Agents
June 28, 2026
Auteurs: Abhranil Chandra, Sankaran Vaidyanathan, Utsav Dhanuka, Varun Gandhi, Scott Niekum
cs.AI
Samenvatting
Grote taalmodellen (Large Language Models, LLM's) worden steeds vaker ingezet om acties in de echte wereld uit te voeren en menselijke besluitvorming te ondersteunen, maar de meeste agenten vertrouwen op parametrische kennis, vaste nabehandelingsgegevens, terugvinden of zoeken. Dit paradigma faalt in nieuwe domeinen en voor complexe query's die niet alleen op basis van voorkennis kunnen worden beantwoord. Het kennen van de natuurwetten stelt LLM's bijvoorbeeld niet op zichzelf in staat om query's te beantwoorden of langdurige taken in een complex fysiek systeem te voltooien. Om dit aan te pakken introduceren we Hiërarchische Experimentele Agenten (Hierarchical Experimentalist Agents, HExA), een context-intern zelfverbeteringsraamwerk om te leren van actieve experimenten. HExA ontwerpt en verfijnt iteratief query-relevante experimenten, bouwt een herbruikbare bibliotheek van samenstelbare vaardigheden op uit ervaring en integreert experimenteel bewijs om query's te beantwoorden of acties te ondernemen. HExA is trainingsvrij, compatibel met elk black-boxmodel en vereist geen externe supervisie, orakels of offline data. Om actieve experimentatie te evalueren introduceren we Interphyre, een tool-gebruikende benchmark die is gebouwd op de PHYRE 2D procedurele fysica-omgeving, waarin agenten interventies voorstellen en hypothesen testen via simulatie-API's. Experimenten tonen aan dat huidige LLM-agenten moeite hebben in deze omgevingen, met name op de moeilijkste niveaus van Interphyre. Claude Sonnet 4.6 behaalt slechts 2% succes, terwijl HExA hetzelfde model verbetert tot 77% succes. HExA verbetert ook opengewichtsmodellen en presteert beter dan agentische baselines zoals ReAct en Reflexion. Bovendien, met alleen vaardigheden die zijn geleerd van eenvoudigere niveaus en overgedragen zonder actieve experimentatie, behaalt HExA 44% succes, wat de herbruikbaarheid en generalisatie van de geleerde vaardigheden aantoont. Over het algemeen laat HExA zien dat leren door actieve experimentatie agenten kan helpen nuttige kennis te ontdekken, herbruikbare vaardigheden te verwerven en efficiënte vooruitgang te boeken bij nieuwe langdurige taken.
English
Large language models (LLMs) are increasingly used to take actions in the real world and support human decision-making, yet most agents rely on parametric knowledge, fixed post-training data, retrieval, or search. This paradigm breaks down in novel domains and for sophisticated queries that cannot be answered from prior knowledge alone. Knowing the laws of physics, for instance, does not by itself enable LLMs to answer queries or complete long-horizon tasks in a complex physical system. To address this, we introduce Hierarchical Experimentalist Agents (HExA), an in-context self-improvement framework to learn from active experimentation. HExA iteratively designs and refines query-relevant experiments, learns a reusable library of composable skills from experience, and integrates experimental evidence to answer queries or take actions. HExA is training-free, compatible with any black-box model, and does not require external supervision, oracles, or offline data. To evaluate active experimentation, we introduce Interphyre, a tool-calling benchmark built on the PHYRE 2D procedural physics environment, where agents propose interventions and test hypotheses through simulation APIs. Experiments show that current LLM agents struggle in these settings, especially on the hardest levels of Interphyre. Claude Sonnet 4.6 achieves only 2% success, while HExA improves the same model to up to 77% success. HExA also improves open-weight models and outperforms agentic baselines such as ReAct and Reflexion. Moreover, using only skills learned from easier levels and transferred without active experimentation, HExA achieves 44% success, demonstrating the reusability and generalization of its learned skills. Overall, HExA shows that learning through active experimentation can help agents discover useful knowledge, acquire reusable skills, and make efficient progress on novel long-horizon tasks.