ChatPaper.aiChatPaper

GigaWorld-1: Een Routekaart om Wereldmodellen te Bouwen voor Robotbeleidsevaluatie

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

July 2, 2026
Auteurs: GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu
cs.AI

Samenvatting

Het evalueren van belichaamde robotfundamentmodellen blijft een kritiek knelpunt; in tegenstelling tot grote taalmodellen die efficiënt kunnen worden beoordeeld via digitale benchmarks, vereisen robotbeleidslijnen trage, kostbare uitrol in de echte wereld, beperkt door hardware en menselijk toezicht. Dit heeft de interesse gewekt in wereldmodellen als surrogaat-beleidsevaluatoren, maar de sleuteleigenschappen die een wereldmodel betrouwbaar maken voor beleidsbeoordeling blijven slecht begrepen. Dit werk presenteert een systematische studie van wereldmodellen voor robotbeleidsevaluatie en introduceert WMBench, een benchmark opgebouwd uit echte robot-teleoperatiedata en bijpassende beleidsuitrol die diverse manipulatie taken bestrijkt, om gecontroleerde vergelijkingen mogelijk te maken tussen modelfamilies, actiecoderingen, uitrolhorizonten en evaluatiemetrieken. Met behulp van WMBench analyseren we 7 videowereldmodellen, 4 actierepresentatieschema's en meer dan 324.000 gesimuleerde beleidsuitrol gekoppeld aan echte robotuitvoeringen. We verrijken onze analyse verder met grootschalige gemeenschapsinzendingen van de CVPR 2026 GigaBrain Challenge, samengestelde synthetische trajecten en trainingsvideo's van meer dan 12.000 uur. Onze experimenten leveren drie kerninzichten op: de kwaliteit van de evaluator wordt gedomineerd door consistentie van actiegetrouwe uitrol op lange termijn, niet door visueel realisme op korte termijn; de voordelen van voortraining komen niet alleen voort uit de schaal van de gegevens, maar ook uit het balanceren van algemene wereldkennis met robotspecifieke bestuurbaarheid; en architectuurkeuzes, waaronder actiecodering, geheugenontwerp en op de evaluator gerichte nabehandeling, bepalen sterk de overeenstemming met echt robotgedrag. Op basis van deze resultaten leiden we een praktische ontwerp routekaart af en realiseren deze in GigaWorld-1, een wereldmodel dat speciaal is geoptimaliseerd voor beleidsevaluatie. We stellen onze code, modellen, datasets en toolkits volledig ter beschikking om schaalbaar evaluatieonderzoek voor belichaamde fundamentmodellen te bevorderen.
English
Evaluating embodied robot foundation models remains a critical bottleneck; unlike large language models efficiently assessed via digital benchmarks, robotic policies require slow, costly real-world rollouts limited by hardware and human supervision, which has driven interest in world models as surrogate policy evaluators, yet the key properties that make a world model reliable for policy assessment remain poorly understood. This work presents a systematic study of world models for robotic policy evaluation and introduces WMBench, a benchmark constructed from real-robot teleoperation data and matched policy rollouts covering diverse manipulation tasks to enable controlled comparisons across model families, action encodings, rollout horizons, and evaluation metrics. Using WMBench, we analyze 7 video world models, 4 action representation schemes, and over 324,000 simulated policy rollouts paired with real robot executions, further enriching our analysis with large-scale community submissions from the CVPR 2026 GigaBrain Challenge, curated synthetic trajectories, and a training videos spanning more than 12,000 hours. Our experiments deliver three core insights: evaluator quality is dominated by long-horizon, action-faithful rollout consistency rather than short-term visual realism; pretraining gains stem not only from data scale but from balancing general world knowledge with robot-specific controllability; and architectural choices including action encoding, memory design, and evaluator-focused post-training strongly determine alignment with real-world robot behavior. Drawing on these results, we derive a practical design roadmap and realize it in GigaWorld-1, a world model specially optimized for policy evaluation, and we fully release our code, models, datasets, and toolkits to advance scalable evaluation research for embodied foundation models.