ChatPaper.aiChatPaper

GigaWorld-1 : une feuille de route pour développer des modèles du monde pour l'évaluation des politiques de robot

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

July 2, 2026
Auteurs: GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu
cs.AI

Résumé

L'évaluation des modèles de fondation robotiques incarnés demeure un goulot d'étranglement critique ; contrairement aux grands modèles de langage, évalués efficacement via des benchmarks numériques, les politiques robotiques nécessitent des déploiements lents et coûteux dans le monde réel, limités par le matériel et la supervision humaine, ce qui a suscité un intérêt pour les modèles du monde en tant qu'évaluateurs de politiques de substitution, mais les propriétés clés qui rendent un modèle du monde fiable pour l'évaluation des politiques restent mal comprises. Ce travail présente une étude systématique des modèles du monde pour l'évaluation des politiques robotiques et introduit WMBench, un benchmark construit à partir de données de téléopération réelle de robots et de déploiements de politiques appariés, couvrant diverses tâches de manipulation afin de permettre des comparaisons contrôlées entre familles de modèles, codages d'actions, horizons de déploiement et métriques d'évaluation. À l'aide de WMBench, nous analysons 7 modèles du monde vidéo, 4 schémas de représentation d'actions et plus de 324 000 déploiements de politiques simulés associés à des exécutions réelles de robots, enrichissant encore notre analyse avec des soumissions à grande échelle de la communauté provenant du défi GigaBrain de CVPR 2026, des trajectoires synthétiques organisées et des vidéos d'entraînement totalisant plus de 12 000 heures. Nos expériences livrent trois idées fondamentales : la qualité de l'évaluateur est dominée par la cohérence de déploiement à long terme et fidèle aux actions, plutôt que par le réalisme visuel à court terme ; les gains du pré-entraînement ne proviennent pas seulement de l'échelle des données, mais aussi de l'équilibre entre les connaissances générales du monde et la contrôlabilité spécifique aux robots ; et les choix architecturaux, y compris le codage des actions, la conception de la mémoire et le post-entraînement axé sur l'évaluateur, déterminent fortement l'alignement avec le comportement réel du robot. En nous appuyant sur ces résultats, nous dérivons une feuille de route de conception pratique et la concrétisons dans GigaWorld-1, un modèle du monde spécialement optimisé pour l'évaluation des politiques, et nous publions intégralement notre code, nos modèles, nos ensembles de données et nos boîtes à outils afin de faire progresser la recherche sur l'évaluation scalable des modèles de fondation incarnés.
English
Evaluating embodied robot foundation models remains a critical bottleneck; unlike large language models efficiently assessed via digital benchmarks, robotic policies require slow, costly real-world rollouts limited by hardware and human supervision, which has driven interest in world models as surrogate policy evaluators, yet the key properties that make a world model reliable for policy assessment remain poorly understood. This work presents a systematic study of world models for robotic policy evaluation and introduces WMBench, a benchmark constructed from real-robot teleoperation data and matched policy rollouts covering diverse manipulation tasks to enable controlled comparisons across model families, action encodings, rollout horizons, and evaluation metrics. Using WMBench, we analyze 7 video world models, 4 action representation schemes, and over 324,000 simulated policy rollouts paired with real robot executions, further enriching our analysis with large-scale community submissions from the CVPR 2026 GigaBrain Challenge, curated synthetic trajectories, and a training videos spanning more than 12,000 hours. Our experiments deliver three core insights: evaluator quality is dominated by long-horizon, action-faithful rollout consistency rather than short-term visual realism; pretraining gains stem not only from data scale but from balancing general world knowledge with robot-specific controllability; and architectural choices including action encoding, memory design, and evaluator-focused post-training strongly determine alignment with real-world robot behavior. Drawing on these results, we derive a practical design roadmap and realize it in GigaWorld-1, a world model specially optimized for policy evaluation, and we fully release our code, models, datasets, and toolkits to advance scalable evaluation research for embodied foundation models.