ChatPaper.aiChatPaper

GigaWorld-1: Um Roteiro para Construir Modelos do Mundo para Avaliação de Políticas Robóticas

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

July 2, 2026
Autores: GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu
cs.AI

Resumo

A avaliação de modelos fundamentais de robôs incorporados continua sendo um gargalo crítico; diferentemente dos grandes modelos de linguagem, que são avaliados eficientemente por meio de benchmarks digitais, as políticas robóticas exigem implementações lentas e caras no mundo real, limitadas por hardware e supervisão humana, o que tem impulsionado o interesse em modelos de mundo como avaliadores substitutos de políticas. No entanto, as propriedades-chave que tornam um modelo de mundo confiável para avaliação de políticas ainda são pouco compreendidas. Este trabalho apresenta um estudo sistemático de modelos de mundo para avaliação de políticas robóticas e introduz o WMBench, um benchmark construído a partir de dados de teleoperação de robôs reais e rollouts de políticas correspondentes, abrangendo diversas tarefas de manipulação, para permitir comparações controladas entre famílias de modelos, codificações de ação, horizontes de rollout e métricas de avaliação. Usando o WMBench, analisamos 7 modelos de mundo de vídeo, 4 esquemas de representação de ação e mais de 324.000 rollouts simulados de políticas emparelhados com execuções reais de robôs, enriquecendo ainda mais nossa análise com submissões em larga escala da comunidade do Desafio GigaBrain da CVPR 2026, trajetórias sintéticas selecionadas e vídeos de treinamento totalizando mais de 12.000 horas. Nossos experimentos fornecem três insights principais: a qualidade do avaliador é dominada pela consistência de rollout de longo horizonte e fiel à ação, em vez do realismo visual de curto prazo; os ganhos de pré-treinamento decorrem não apenas da escala de dados, mas do equilíbrio entre conhecimento geral do mundo e controlabilidade específica do robô; e as escolhas arquitetônicas, incluindo codificação de ação, design de memória e pós-treinamento focado no avaliador, determinam fortemente o alinhamento com o comportamento real do robô. Com base nesses resultados, derivamos um roteiro de design prático e o concretizamos no GigaWorld-1, um modelo de mundo especialmente otimizado para avaliação de políticas, e disponibilizamos integralmente nosso código, modelos, conjuntos de dados e ferramentas para avançar a pesquisa de avaliação escalável para modelos fundamentais incorporados.
English
Evaluating embodied robot foundation models remains a critical bottleneck; unlike large language models efficiently assessed via digital benchmarks, robotic policies require slow, costly real-world rollouts limited by hardware and human supervision, which has driven interest in world models as surrogate policy evaluators, yet the key properties that make a world model reliable for policy assessment remain poorly understood. This work presents a systematic study of world models for robotic policy evaluation and introduces WMBench, a benchmark constructed from real-robot teleoperation data and matched policy rollouts covering diverse manipulation tasks to enable controlled comparisons across model families, action encodings, rollout horizons, and evaluation metrics. Using WMBench, we analyze 7 video world models, 4 action representation schemes, and over 324,000 simulated policy rollouts paired with real robot executions, further enriching our analysis with large-scale community submissions from the CVPR 2026 GigaBrain Challenge, curated synthetic trajectories, and a training videos spanning more than 12,000 hours. Our experiments deliver three core insights: evaluator quality is dominated by long-horizon, action-faithful rollout consistency rather than short-term visual realism; pretraining gains stem not only from data scale but from balancing general world knowledge with robot-specific controllability; and architectural choices including action encoding, memory design, and evaluator-focused post-training strongly determine alignment with real-world robot behavior. Drawing on these results, we derive a practical design roadmap and realize it in GigaWorld-1, a world model specially optimized for policy evaluation, and we fully release our code, models, datasets, and toolkits to advance scalable evaluation research for embodied foundation models.