GigaWorld-1: Una hoja de ruta para construir modelos del mundo para la evaluación de políticas de robots
GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
July 2, 2026
Autores: GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu
cs.AI
Resumen
Evaluar modelos fundacionales de robots encarnados sigue siendo un cuello de botella crítico; a diferencia de los grandes modelos de lenguaje, que se evalúan eficientemente mediante puntos de referencia digitales, las políticas robóticas requieren despliegues lentos y costosos en el mundo real, limitados por el hardware y la supervisión humana, lo que ha impulsado el interés en los modelos del mundo como evaluadores sustitutos de políticas. Sin embargo, las propiedades clave que hacen que un modelo del mundo sea fiable para la evaluación de políticas siguen sin comprenderse bien. Este trabajo presenta un estudio sistemático de modelos del mundo para la evaluación de políticas robóticas e introduce WMBench, un punto de referencia construido a partir de datos de teleoperación robótica real y despliegues de políticas emparejados que abarcan diversas tareas de manipulación, permitiendo comparaciones controladas entre familias de modelos, codificaciones de acciones, horizontes de despliegue y métricas de evaluación. Utilizando WMBench, analizamos 7 modelos del mundo de video, 4 esquemas de representación de acciones y más de 324,000 despliegues de políticas simulados emparejados con ejecuciones robóticas reales, enriqueciendo aún más nuestro análisis con envíos comunitarios a gran escala del Desafío GigaBrain de CVPR 2026, trayectorias sintéticas curadas y videos de entrenamiento que abarcan más de 12,000 horas. Nuestros experimentos ofrecen tres ideas centrales: la calidad del evaluador está dominada por la consistencia de despliegue a largo plazo y fiel a la acción, más que por el realismo visual a corto plazo; las ganancias del preentrenamiento provienen no solo de la escala de datos, sino del equilibrio entre el conocimiento general del mundo y la controlabilidad específica del robot; y las elecciones arquitectónicas, incluyendo la codificación de acciones, el diseño de memoria y el post-entrenamiento centrado en el evaluador, determinan fuertemente la alineación con el comportamiento robótico real. Basándonos en estos resultados, derivamos una hoja de ruta de diseño práctica y la materializamos en GigaWorld-1, un modelo del mundo especialmente optimizado para la evaluación de políticas, y liberamos completamente nuestro código, modelos, conjuntos de datos y conjuntos de herramientas para avanzar en la investigación de evaluación escalable para modelos fundacionales encarnados.
English
Evaluating embodied robot foundation models remains a critical bottleneck; unlike large language models efficiently assessed via digital benchmarks, robotic policies require slow, costly real-world rollouts limited by hardware and human supervision, which has driven interest in world models as surrogate policy evaluators, yet the key properties that make a world model reliable for policy assessment remain poorly understood. This work presents a systematic study of world models for robotic policy evaluation and introduces WMBench, a benchmark constructed from real-robot teleoperation data and matched policy rollouts covering diverse manipulation tasks to enable controlled comparisons across model families, action encodings, rollout horizons, and evaluation metrics. Using WMBench, we analyze 7 video world models, 4 action representation schemes, and over 324,000 simulated policy rollouts paired with real robot executions, further enriching our analysis with large-scale community submissions from the CVPR 2026 GigaBrain Challenge, curated synthetic trajectories, and a training videos spanning more than 12,000 hours. Our experiments deliver three core insights: evaluator quality is dominated by long-horizon, action-faithful rollout consistency rather than short-term visual realism; pretraining gains stem not only from data scale but from balancing general world knowledge with robot-specific controllability; and architectural choices including action encoding, memory design, and evaluator-focused post-training strongly determine alignment with real-world robot behavior. Drawing on these results, we derive a practical design roadmap and realize it in GigaWorld-1, a world model specially optimized for policy evaluation, and we fully release our code, models, datasets, and toolkits to advance scalable evaluation research for embodied foundation models.