ChatPaper.aiChatPaper

SimWorld Studio: Automatische Omgevingsgeneratie met een Evoluerende Code-agent voor het Leren van Belichaamde Agenten

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning

May 10, 2026
Auteurs: Haoqiang Kang, Xiaokang Ye, Yuhan Liu, Siddhant Hitesh Mantri, Lingjun Mao, James Fleming, Drishti Regmi, Lianhui Qin
cs.AI

Samenvatting

LLM/VLM-gebaseerde digitale agenten hebben zich snel ontwikkeld dankzij schaalbare zandbakken voor coderen, webnavigatie en computergebruik, die rijke interactieve trainingsomgevingen bieden. Daarentegen missen geïmplementeerde agenten nog steeds overvloedige, diverse en automatisch gegenereerde 3D-omgevingen voor interactief leren. Bestaande geïmplementeerde simulatoren zijn afhankelijk van handmatig ontworpen scènes of procedurele sjablonen, terwijl recente LLM-gebaseerde 3D-generatiesystemen voornamelijk statische scènes produceren in plaats van inzetbare omgevingen met verifieerbare taken en standaard leerinterfaces. We introduceren SimWorld Studio, een open-source platform gebouwd op Unreal Engine 5 voor het genereren van evoluerende geïmplementeerde leeromgevingen. De kern is SimCoder, een tool/vaardigheid-verbeterde codeeragent die engine-niveau code schrijft en uitvoert om fysiek verankerde 3D-werelden te construeren op basis van taal-/beeldinstructies. SimCoder evolueert zelf door gebruik te maken van verificatorfeedback (bijv. compilatiefouten, fysicacontroles, VLM-kritieken) om omgevingen te herzien en autonoom herbruikbare tools en vaardigheden aan zijn bibliotheek toe te voegen. Gegenereerde werelden worden geëxporteerd als Gym-achtige omgevingen voor het leren van geïmplementeerde agenten. SimWorld Studio maakt verder co-evolutie mogelijk tussen omgevingsgeneratie en geïmplementeerd leren: feedback over de prestaties van agenten leidt SimCoder ertoe adaptieve curricula te genereren nabij de vaardigheidsgrens van de leerling, zodat omgevingen steeds uitdagender worden naarmate de geïmplementeerde agent verbetert. Drie casestudies over geïmplementeerde navigatie tonen aan dat zelfevolutie de generatiebetrouwbaarheid verbetert, gegenereerde omgevingen de prestaties van de geïmplementeerde agent aanzienlijk verbeteren, wat generaliseert naar onbekende benchmarks, en co-evolutie levert een winst van 18 procentpunten in succespercentage op ten opzichte van leren in een vaste omgeving en een winst van 40 procentpunten ten opzichte van een ongetrainde agent.
English
LLM/VLM-based digital agents have advanced rapidly thanks to scalable sandboxes for coding, web navigation, and computer use, which provide rich interactive training grounds. In contrast, embodied agents still lack abundant, diverse, and automatically generated 3D environments for interactive learning. Existing embodied simulators rely on manually crafted scenes or procedural templates, while recent LLM-based 3D generation systems mainly produce static scenes rather than deployable environments with verifiable tasks and standard learning interfaces. We introduce SimWorld Studio, an open-source platform built on Unreal Engine 5 for generating evolving embodied learning environments. At its core is SimCoder, a tool/skill-augmented coding agent that writes and executes engine-level code to construct physically grounded 3D worlds from language/image instructions. SimCoder self-evolves by using verifier feedback (e.g., compilation errors, physics checks, VLM critiques) to revise environments and autonomously add reusable tools and skills to its library. Generated worlds are exported as Gym-style environments for embodied agent learning. SimWorld Studio further enables co-evolution between environment generation and embodied learning: agent performance feedback guides SimCoder to generate adaptive curricula near the learner's capability frontier, so that environments become increasingly challenging as the embodied agent improves. Three case studies on embodied navigation show that self-evolution improves generation reliability, generated environments substantially improve embodied agent performance that generalizes to unseen benchmarks, and co-evolution yields an 18-point success-rate gain over fixed-environment learning and a 40-point gain over an untrained agent.