GigaWorld-Policy-0.5: Ein schnelleres und stärkeres WAM, unterstützt durch AutoResearch
GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch
July 15, 2026
Autoren: GigaWorld Team, Angen Ye, Angyuan Ma, Boyuan Wang, Chaojun Ni, Fangzheng Ye, Guan Huang, Guo Li, Guosheng Zhao, Haodong Yan, Hengtao Li, Jiwen Lu, Kai Wang, Mingming Yu, Qitang Hu, Qiuping Deng, Songling Liu, Xiaoyu Tian, Xiaofeng Wang, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Yang Wang, Yejun Zeng, Yifan Chang, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu
cs.AI
Zusammenfassung
Weltaktionsmodelle (World Action Models, WAMs) verbessern das Policy-Lernen für Roboter, indem sie Aktionen und zukünftige visuelle Beobachtungen gemeinsam modellieren und die zukünftige Szenenentwicklung als dichte Überwachung für eine physikalisch fundierte Aktionsgenerierung nutzen. Ein gängiges Design in bestehenden WAMs besteht jedoch darin, zum Zeitpunkt der Inferenz explizit zukünftige Videos zu generieren, was einen erheblichen Rechenaufwand verursacht und den Echtzeit-Closed-Loop-Einsatz behindert. GigaWorld-Policy begegnet diesem Problem mit einer handlungszentrierten Formulierung, bei der zukünftige visuelle Dynamiken während des Trainings verwendet werden, während zur Inferenzzeit eine handlungsreine Dekodierung erfolgt. Aufbauend auf diesem Rahmen stellen wir GigaWorld-Policy-0.5 vor, ein verbessertes handlungszentriertes WAM, das für eine effizientere Robotersteuerung entwickelt wurde. Während des Vortrainings übernimmt GigaWorld-Policy-0.5 eine gemischte Trainingsstrategie aus handlungskonditionierter Weltmodellierung (Action-Conditioned World Modeling, AC-WM) und WAM. Dies stärkt die Kopplung zwischen visueller Dynamik und Roboteraktionen und verbessert die Übertragbarkeit von Aktionsrepräsentationen für das nachgelagerte Policy-Lernen. Für eine effiziente Inferenz führt GigaWorld-Policy-0.5 eine Mixture-of-Transformers-Architektur ein, die die Modellierung visueller Dynamiken und die Aktionsgenerierung in spezialisierte Experten aufteilt, wodurch die aktive Berechnung während der handlungsreinen Inferenz reduziert und eine Inferenzlatenz von 85 ms auf einem lokalen RTX 4090-Setup erreicht wird. Darüber hinaus setzen wir eine agentenbasierte AutoResearch-Pipeline ein, um Trainingskonfigurationen systematisch zu durchsuchen, was eine effizientere Identifizierung optimaler Versuchsaufbauten ermöglicht und gleichzeitig den Zeitaufwand und die manuellen Eingriffe für die Hyperparameter-Optimierung reduziert. Experimente und Ablationen zeigen, dass GigaWorld-Policy-0.5 die Trainingsvorteile der zukünftigen visuellen Dynamik bewahrt und gleichzeitig die Inferenzeffizienz für die Robotersteuerung verbessert.
English
World Action Models (WAMs) improve robot policy learning by jointly modeling actions and future visual observations, using future scene evolution as dense supervision for physically grounded action generation. However, a common design in existing WAMs is to explicitly generate future videos at inference time, incurring substantial computational overhead and hindering real-time closed-loop deployment. GigaWorld-Policy addresses this issue with an action-centered formulation, where future visual dynamics are used during training while action-only decoding is used at inference time. Building upon this framework, we present GigaWorld-Policy-0.5, an enhanced action-centered WAM designed for more efficient robot control. During pretraining, GigaWorld-Policy-0.5 adopts a mixed Action-Conditioned World Modeling (AC-WM) and WAM training strategy. This strengthens the coupling between visual dynamics and robot actions and improves the transferability of action representations for downstream policy learning. For efficient inference, GigaWorld-Policy-0.5 introduces a Mixture-of-Transformers architecture that separates visual dynamics modeling and action generation into specialized experts, reducing active computation during action-only inference and achieving 85 ms inference latency on a local RTX 4090 setup. In addition, we employ an agent-based AutoResearch pipeline to systematically search training configurations, enabling more efficient identification of optimal experimental setups while reducing the time and manual intervention required for hyperparameter tuning. Experiments and ablations show that GigaWorld-Policy-0.5 preserves the training benefits of future visual dynamics while improving inference efficiency for robot control.