GigaWorld-1: Дорожная карта по построению моделей мира для оценки политик роботов
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
July 2, 2026
Авторы: GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu
cs.AI
Аннотация
Оценка воплощённых фундаментальных моделей для роботов остаётся критическим узким местом: в отличие от больших языковых моделей, эффективно оцениваемых с помощью цифровых бенчмарков, роботизированные политики требуют медленных, затратных развёртываний в реальном мире, ограниченных оборудованием и человеческим контролем, что стимулирует интерес к моделям мира в качестве суррогатных оценщиков политик, однако ключевые свойства, определяющие надёжность модели мира для оценки политик, остаются слабо изученными. В данной работе представлено систематическое исследование моделей мира для оценки роботизированных политик и вводится WMBench — бенчмарк, построенный на данных телемации реальных роботов и соответствующих развёртываний политик, охватывающий разнообразные задачи манипуляции, что позволяет проводить контролируемые сравнения между семействами моделей, кодировками действий, горизонтами развёртывания и метриками оценки. Используя WMBench, мы анализируем 7 видеомоделей мира, 4 схемы представления действий и более 324 000 симулированных развёртываний политик в паре с реальными исполнениями роботов, дополнительно обогащая наш анализ крупномасштабными поступлениями от сообщества в рамках GigaBrain Challenge на CVPR 2026, кураторскими синтетическими траекториями и обучающими видео общей длительностью свыше 12 000 часов. Наши эксперименты дают три ключевых вывода: качество оценщика определяется в первую очередь согласованностью развёртываний на длинных горизонтах с точным следованием действиям, а не краткосрочным визуальным реализмом; преимущества предобучения обусловлены не только масштабом данных, но и балансом между общими знаниями о мире и управляемостью, специфичной для роботов; архитектурные решения, включая кодировку действий, дизайн памяти и последующее обучение, ориентированное на оценщик, сильно определяют согласованность с реальным поведением робота. Основываясь на этих результатах, мы выводим практическую дорожную карту и реализуем её в GigaWorld-1 — модели мира, специально оптимизированной для оценки политик, и полностью публикуем наш код, модели, наборы данных и инструментарий для продвижения масштабируемых исследований оценки воплощённых фундаментальных моделей.
English
Evaluating embodied robot foundation models remains a critical bottleneck; unlike large language models efficiently assessed via digital benchmarks, robotic policies require slow, costly real-world rollouts limited by hardware and human supervision, which has driven interest in world models as surrogate policy evaluators, yet the key properties that make a world model reliable for policy assessment remain poorly understood. This work presents a systematic study of world models for robotic policy evaluation and introduces WMBench, a benchmark constructed from real-robot teleoperation data and matched policy rollouts covering diverse manipulation tasks to enable controlled comparisons across model families, action encodings, rollout horizons, and evaluation metrics. Using WMBench, we analyze 7 video world models, 4 action representation schemes, and over 324,000 simulated policy rollouts paired with real robot executions, further enriching our analysis with large-scale community submissions from the CVPR 2026 GigaBrain Challenge, curated synthetic trajectories, and a training videos spanning more than 12,000 hours. Our experiments deliver three core insights: evaluator quality is dominated by long-horizon, action-faithful rollout consistency rather than short-term visual realism; pretraining gains stem not only from data scale but from balancing general world knowledge with robot-specific controllability; and architectural choices including action encoding, memory design, and evaluator-focused post-training strongly determine alignment with real-world robot behavior. Drawing on these results, we derive a practical design roadmap and realize it in GigaWorld-1, a world model specially optimized for policy evaluation, and we fully release our code, models, datasets, and toolkits to advance scalable evaluation research for embodied foundation models.