GigaWorld-Policy-0.5 : Un WAM plus rapide et plus puissant propulsé par AutoResearch
GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
July 15, 2026
Auteurs: GigaWorld Team, Angen Ye, Angyuan Ma, Boyuan Wang, Chaojun Ni, Fangzheng Ye, Guan Huang, Guo Li, Guosheng Zhao, Haodong Yan, Hengtao Li, Jiwen Lu, Kai Wang, Mingming Yu, Qitang Hu, Qiuping Deng, Songling Liu, Xiaoyu Tian, Xiaofeng Wang, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Yang Wang, Yejun Zeng, Yifan Chang, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu
cs.AI
Résumé
Les modèles d'action du monde (World Action Models, WAMs) améliorent l'apprentissage des politiques des robots en modélisant conjointement les actions et les observations visuelles futures, utilisant l'évolution future de la scène comme supervision dense pour la génération d'actions ancrées physiquement. Cependant, une conception courante dans les WAMs existants consiste à générer explicitement des vidéos futures au moment de l'inférence, ce qui entraîne une charge de calcul substantielle et nuit au déploiement en boucle fermée en temps réel. GigaWorld-Policy résout ce problème avec une formulation centrée sur l'action, où la dynamique visuelle future est utilisée pendant l'entraînement tandis qu'un décodage uniquement basé sur l'action est employé au moment de l'inférence. En nous appuyant sur ce cadre, nous présentons GigaWorld-Policy-0.5, un WAM centré sur l'action amélioré, conçu pour un contrôle robotique plus efficace. Pendant le pré-entraînement, GigaWorld-Policy-0.5 adopte une stratégie d'entraînement mixte combinant la modélisation du monde conditionnée par l'action (Action-Conditioned World Modeling, AC-WM) et les WAMs. Cela renforce le couplage entre la dynamique visuelle et les actions du robot, et améliore la transférabilité des représentations d'action pour l'apprentissage des politiques en aval. Pour une inférence efficace, GigaWorld-Policy-0.5 introduit une architecture Mixture-of-Transformers qui sépare la modélisation de la dynamique visuelle et la génération d'actions en experts spécialisés, réduisant le calcul actif lors de l'inférence uniquement basée sur l'action et atteignant une latence d'inférence de 85 ms sur une configuration locale RTX 4090. De plus, nous utilisons un pipeline AutoResearch basé sur un agent pour rechercher systématiquement les configurations d'entraînement, permettant une identification plus efficace des configurations expérimentales optimales tout en réduisant le temps et l'intervention manuelle nécessaires au réglage des hyperparamètres. Les expériences et les ablations montrent que GigaWorld-Policy-0.5 préserve les avantages d'entraînement de la dynamique visuelle future tout en améliorant l'efficacité de l'inférence pour le contrôle robotique.
English
World Action Models (WAMs) improve robot policy learning by jointly modeling actions and future visual observations, using future scene evolution as dense supervision for physically grounded action generation. However, a common design in existing WAMs is to explicitly generate future videos at inference time, incurring substantial computational overhead and hindering real-time closed-loop deployment. GigaWorld-Policy addresses this issue with an action-centered formulation, where future visual dynamics are used during training while action-only decoding is used at inference time. Building upon this framework, we present GigaWorld-Policy-0.5, an enhanced action-centered WAM designed for more efficient robot control. During pretraining, GigaWorld-Policy-0.5 adopts a mixed Action-Conditioned World Modeling (AC-WM) and WAM training strategy. This strengthens the coupling between visual dynamics and robot actions and improves the transferability of action representations for downstream policy learning. For efficient inference, GigaWorld-Policy-0.5 introduces a Mixture-of-Transformers architecture that separates visual dynamics modeling and action generation into specialized experts, reducing active computation during action-only inference and achieving 85 ms inference latency on a local RTX 4090 setup. In addition, we employ an agent-based AutoResearch pipeline to systematically search training configurations, enabling more efficient identification of optimal experimental setups while reducing the time and manual intervention required for hyperparameter tuning. Experiments and ablations show that GigaWorld-Policy-0.5 preserves the training benefits of future visual dynamics while improving inference efficiency for robot control.