ChatPaper.aiChatPaper

RoboDojo : un benchmark unifié simulation et réalité pour l'évaluation exhaustive des politiques généralistes de manipulation robotique

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

July 7, 2026
Auteurs: Tianxing Chen, Yue Chen, Zixuan Li, Junyuan Tang, Kailun Su, Haoran Lu, Weijie Wan, Baijun Chen, Songling Liu, Haowen Yan, Honghao Su, Zhiyang Dou, Kaixuan Wang, Dandan Zhang, Yunze Liu, Yan Qin, Qiwei Liang, Qiwei Wu, Zijian Lin, Wenwei Lin, Yuran Wang, Minghua He, Tianshu Wu, Ruihai Wu, Jingquan Zhou, Kai-Chong Lei, Haibao Yu, Yuanfeng Ji, Weiyang Jin, Guanyu Lin, Xiaofan Li, Qi Xiong, Renjing Xu, Zhongyu Li, Wenhao Chai, Enze Xie, Ziwei Wang, Yao Mu, Hao Dong, Wojciech Matusik, Mingyu Ding, Wenbo Ding, Ping Luo, Masayoshi Tomizuka
cs.AI

Résumé

Les politiques de manipulation robotique généralistes ont progressé rapidement, mais les benchmarks existants restent limités pour évaluer systématiquement leurs capacités. Beaucoup reposent sur des tâches simples, à horizon temporel court ou à compétences restreintes, avec une couverture fonctionnelle limitée, et sont souvent menées uniquement en simulation ou uniquement dans le monde réel. La simulation permet un retour d'information à grande échelle mais néglige les défis du déploiement physique, tandis que l'évaluation dans le monde réel est coûteuse, chronophage et difficile à reproduire. Nous présentons RoboDojo, un benchmark unifié sim-et-réel pour l'évaluation complète des politiques de manipulation robotique généralistes. RoboDojo inclut 42 tâches de simulation et 18 tâches réelles couvrant des capacités de manipulation diverses et complémentaires. Le benchmark de simulation évalue cinq dimensions : la généralisation, la mémoire, la précision, l'exécution à long horizon et le suivi d'instructions à vocabulaire ouvert, tandis que le benchmark réel expose les politiques à des conditions de déploiement physique difficiles. RoboDojo prend en charge une évaluation évolutive grâce à une simulation parallèle hétérogène dans Isaac Sim et fournit RoboDojo-RealEval, un système d'évaluation reproductible dans le monde réel avec accès cloud à distance, matériel standardisé, réinitialisation de scène, protocole d'évaluation et interface de déploiement. Avec XPolicyLab, les politiques peuvent être intégrées une fois et évaluées à la fois en simulation et dans le monde réel avec une adaptation minimale. Nous intégrons 30 politiques dans XPolicyLab et les évaluons sur RoboDojo, établissant un classement public et une analyse systématique des performances actuelles des politiques. Le site web est accessible à l'adresse http://robodojo-benchmark.com/.
English
Generalist robot manipulation policies have advanced rapidly, yet existing benchmarks remain limited in systematically evaluating their capabilities. Many rely on simple, short-horizon, or skill-narrow tasks with limited capability coverage, and are often conducted only in simulation or only in the real world. Simulation enables scalable feedback but misses physical deployment challenges, while real-world evaluation is costly, time-consuming, and difficult to reproduce. We introduce RoboDojo, a unified sim-and-real benchmark for comprehensive evaluation of generalist robot manipulation policies. RoboDojo includes 42 simulation tasks and 18 real-world tasks covering diverse and complementary manipulation capabilities. The simulation benchmark evaluates five dimensions: generalization, memory, precision, long-horizon execution, and open-vocabulary instruction following, while the real-world benchmark exposes policies to challenging physical-world deployment conditions. RoboDojo supports scalable evaluation through heterogeneous parallel simulation in Isaac Sim and provides RoboDojo-RealEval, a reproducible real-world evaluation system with remote cloud access, standardized hardware, scene reset, evaluation protocol, and deployment interface. Together with XPolicyLab, policies can be integrated once and evaluated across simulation and real-world settings with minimal adaptation. We integrate 30 policies into XPolicyLab and evaluate them on RoboDojo, establishing a public leaderboard and systematic analysis of current policy performance. The website is available at http://robodojo-benchmark.com/.