SimWorld Studio : Génération automatique d'environnements avec un agent de codage évolutif pour l'apprentissage d'agents incarnés
SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning
May 10, 2026
Auteurs: Haoqiang Kang, Xiaokang Ye, Yuhan Liu, Siddhant Hitesh Mantri, Lingjun Mao, James Fleming, Drishti Regmi, Lianhui Qin
cs.AI
Résumé
Les agents numériques basés sur LLM/VLM ont progressé rapidement grâce à des bacs à sable évolutifs pour le codage, la navigation web et l'utilisation d'ordinateurs, offrant des terrains d'entraînement interactifs riches. En revanche, les agents incarnés manquent encore d'environnements 3D abondants, diversifiés et générés automatiquement pour un apprentissage interactif. Les simulateurs incarnés existants reposent sur des scènes conçues manuellement ou des modèles procéduraux, tandis que les récents systèmes de génération 3D basés sur LLM produisent principalement des scènes statiques plutôt que des environnements déployables avec des tâches vérifiables et des interfaces d'apprentissage standard. Nous présentons SimWorld Studio, une plateforme open-source construite sur Unreal Engine 5 pour générer des environnements d'apprentissage incarné en évolution. Son cœur est SimCoder, un agent de codage augmenté d'outils/compétences qui écrit et exécute du code au niveau du moteur pour construire des mondes 3D physiquement fondés à partir d'instructions langagières/visuelles. SimCoder évolue de lui-même en utilisant le feedback de vérificateurs (par exemple, erreurs de compilation, vérifications physiques, critiques VLM) pour réviser les environnements et ajouter de manière autonome des outils et compétences réutilisables à sa bibliothèque. Les mondes générés sont exportés sous forme d'environnements de type Gym pour l'apprentissage des agents incarnés. SimWorld Studio permet en outre une co-évolution entre la génération d'environnements et l'apprentissage incarné : le feedback de performance de l'agent guide SimCoder pour générer des programmes adaptatifs proches de la frontière de capacité de l'apprenant, de sorte que les environnements deviennent de plus en plus difficiles à mesure que l'agent incarné s'améliore. Trois études de cas sur la navigation incarnée montrent que l'auto-évolution améliore la fiabilité de la génération, que les environnements générés améliorent considérablement les performances de l'agent incarné, lesquelles se généralisent à des benchmarks inconnus, et que la co-évolution produit un gain de taux de réussite de 18 points par rapport à un apprentissage en environnement fixe et de 40 points par rapport à un agent non entraîné.
English
LLM/VLM-based digital agents have advanced rapidly thanks to scalable sandboxes for coding, web navigation, and computer use, which provide rich interactive training grounds. In contrast, embodied agents still lack abundant, diverse, and automatically generated 3D environments for interactive learning. Existing embodied simulators rely on manually crafted scenes or procedural templates, while recent LLM-based 3D generation systems mainly produce static scenes rather than deployable environments with verifiable tasks and standard learning interfaces. We introduce SimWorld Studio, an open-source platform built on Unreal Engine 5 for generating evolving embodied learning environments. At its core is SimCoder, a tool/skill-augmented coding agent that writes and executes engine-level code to construct physically grounded 3D worlds from language/image instructions. SimCoder self-evolves by using verifier feedback (e.g., compilation errors, physics checks, VLM critiques) to revise environments and autonomously add reusable tools and skills to its library. Generated worlds are exported as Gym-style environments for embodied agent learning. SimWorld Studio further enables co-evolution between environment generation and embodied learning: agent performance feedback guides SimCoder to generate adaptive curricula near the learner's capability frontier, so that environments become increasingly challenging as the embodied agent improves. Three case studies on embodied navigation show that self-evolution improves generation reliability, generated environments substantially improve embodied agent performance that generalizes to unseen benchmarks, and co-evolution yields an 18-point success-rate gain over fixed-environment learning and a 40-point gain over an untrained agent.