GigaWorld-Policy-0.5: Een snellere en sterkere WAM, mogelijk gemaakt door AutoResearch
GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
July 15, 2026
Auteurs: GigaWorld Team, Angen Ye, Angyuan Ma, Boyuan Wang, Chaojun Ni, Fangzheng Ye, Guan Huang, Guo Li, Guosheng Zhao, Haodong Yan, Hengtao Li, Jiwen Lu, Kai Wang, Mingming Yu, Qitang Hu, Qiuping Deng, Songling Liu, Xiaoyu Tian, Xiaofeng Wang, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Yang Wang, Yejun Zeng, Yifan Chang, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu
cs.AI
Samenvatting
World Action Models (WAM's) verbeteren het aanleren van robotbeleid door simultaan acties en toekomstige visuele observaties te modelleren, waarbij toekomstige scène-evolutie wordt gebruikt als dichte supervisie voor fysiek gefundeerde actiegeneratie. Echter, een veelvoorkomend ontwerp in bestaande WAM's is om expliciet toekomstige video's te genereren tijdens inferentie, wat aanzienlijke computationele overhead met zich meebrengt en real-time closed-loop implementatie belemmert. GigaWorld-Policy pakt dit probleem aan met een actiegecentreerde formulering, waarbij toekomstige visuele dynamica wordt gebruikt tijdens training terwijl alleen actie-decodering wordt gebruikt tijdens inferentie. Voortbouwend op dit raamwerk presenteren we GigaWorld-Policy-0.5, een verbeterde actiegecentreerde WAM ontworpen voor efficiëntere robotbesturing. Tijdens voorbereidende training hanteert GigaWorld-Policy-0.5 een gemengde strategie van Action-Conditioned World Modeling (AC-WM) en WAM-training. Dit versterkt de koppeling tussen visuele dynamica en robotacties en verbetert de overdraagbaarheid van actierepresentaties voor downstream beleidsleren. Voor efficiënte inferentie introduceert GigaWorld-Policy-0.5 een Mixture-of-Transformers-architectuur die visuele dynamica-modellering en actiegeneratie scheidt in gespecialiseerde experts, waardoor actieve berekening tijdens alleen-actie-inferentie wordt verminderd en een inferentielatentie van 85 ms wordt bereikt op een lokale RTX 4090-opstelling. Daarnaast gebruiken we een agentgebaseerde AutoResearch-pijplijn om systematisch trainingsconfiguraties te doorzoeken, wat een efficiëntere identificatie van optimale experimentele opstellingen mogelijk maakt, terwijl de tijd en handmatige interventie die nodig zijn voor hyperparameteroptimalisatie worden verminderd. Experimenten en ablatiestudies tonen aan dat GigaWorld-Policy-0.5 de trainingsvoordelen van toekomstige visuele dynamica behoudt terwijl de inferentie-efficiëntie voor robotbesturing wordt verbeterd.
English
World Action Models (WAMs) improve robot policy learning by jointly modeling actions and future visual observations, using future scene evolution as dense supervision for physically grounded action generation. However, a common design in existing WAMs is to explicitly generate future videos at inference time, incurring substantial computational overhead and hindering real-time closed-loop deployment. GigaWorld-Policy addresses this issue with an action-centered formulation, where future visual dynamics are used during training while action-only decoding is used at inference time. Building upon this framework, we present GigaWorld-Policy-0.5, an enhanced action-centered WAM designed for more efficient robot control. During pretraining, GigaWorld-Policy-0.5 adopts a mixed Action-Conditioned World Modeling (AC-WM) and WAM training strategy. This strengthens the coupling between visual dynamics and robot actions and improves the transferability of action representations for downstream policy learning. For efficient inference, GigaWorld-Policy-0.5 introduces a Mixture-of-Transformers architecture that separates visual dynamics modeling and action generation into specialized experts, reducing active computation during action-only inference and achieving 85 ms inference latency on a local RTX 4090 setup. In addition, we employ an agent-based AutoResearch pipeline to systematically search training configurations, enabling more efficient identification of optimal experimental setups while reducing the time and manual intervention required for hyperparameter tuning. Experiments and ablations show that GigaWorld-Policy-0.5 preserves the training benefits of future visual dynamics while improving inference efficiency for robot control.