RoboEvolve : Planificateur-Simulateur co-évolutif pour la manipulation robotique avec des données limitées
RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data
May 13, 2026
Auteurs: Harold Haodong Chen, Sirui Chen, Yingjie Xu, Wenhang Ge, Ying-Cong Chen
cs.AI
Résumé
L'évolutivité de la manipulation robotique est fondamentalement limitée par la rareté des données d'interaction physique alignées sur les tâches. Bien que les modèles de vision-langage (VLM) et les modèles de génération vidéo (VGM) soient prometteurs pour la synthèse autonome de données, ils souffrent respectivement d'un désalignement sémantique-spatial et d'hallucinations physiques. Pour combler cet écart, nous présentons RoboEvolve, un nouveau cadre qui couple un planificateur VLM et un simulateur VGM dans une boucle de co-évolution mutuellement renforçante. Fonctionnant uniquement à partir d'images sources non étiquetées, RoboEvolve exploite un mécanisme à double phase inspiré de la cognition : (i) l'exploration diurne favorise la découverte de comportements ancrés physiquement via une récompense multi-granulaire contrôlée sémantiquement, et (ii) la consolidation nocturne exploite les échecs « quasi-réussis » pour stabiliser l'optimisation de la politique. Guidé par un programme progressif autonome, le système s'étend naturellement des actions atomiques simples aux tâches complexes. Des expériences approfondies démontrent que RoboEvolve (I) atteint une efficacité supérieure, élevant les planificateurs de base de 30 points absolus et amplifiant le succès du simulateur de 48 % en moyenne ; (II) présente une efficacité des données extrême, surpassant les références entièrement supervisées avec seulement 500 sources non étiquetées — une réduction de 50 fois ; et (III) démontre un apprentissage continu robuste sans oubli catastrophique.
English
The scalability of robotic manipulation is fundamentally bottlenecked by the scarcity of task-aligned physical interaction data. While vision-language models (VLMs) and video generation models (VGMs) hold promise for autonomous data synthesis, they suffer from semantic-spatial misalignment and physical hallucinations, respectively. To bridge this gap, we introduce RoboEvolve, a novel framework that couples a VLM planner and a VGM simulator into a mutually reinforcing co-evolutionary loop. Operating purely on unlabeled seed images, RoboEvolve leverages a cognitive-inspired dual-phase mechanism: (i) daytime exploration fosters physically grounded behavioral discovery through a semantic-controlled multi-granular reward, and (ii) nighttime consolidation mines "near-miss" failures to stabilize policy optimization. Guided by an autonomous progressive curriculum, the system naturally scales from simple atomic actions to complex tasks. Extensive experiments demonstrate that RoboEvolve (I) achieves superior effectiveness, elevating base planners by 30 absolute points and amplifying simulator success by 48% on average; (II) exhibits extreme data efficiency, surpassing fully supervised baselines with merely 500 unlabeled seeds--a 50x reduction; and (III) demonstrates robust continual learning without catastrophic forgetting.