GigaBrain-0.7:三系統アーキテクチャによる身体化基盤モデルの創発的能力へのスケーリング
GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
August 16, 2026
著者: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu
cs.AI
要旨
視覚・言語・行動(VLA)モデルは、汎用身体化エージェントの支配的なパラダイムとなり、構造化された環境における複雑かつ長期的なタスク完了において強力な性能を示してきた。しかしながら、現在のVLAシステムがより効果的なアーキテクチャ設計から恩恵を受け得るか、大幅に大規模で異種混在のデータレジームへスケールアップできるか、そしてタスクおよび身体形態を横断するより広範な汎化を達成できるかは、依然として未解決の問いである。この課題に対処するため、我々は多様なロボット身体形態にわたって大幅に改善された汎化を実現する身体化基盤モデルであるGigaBrain-0.7を提案する。具体的には、GigaBrain-0.7は三系統アーキテクチャを通じて理解・予測・行動を統合し、37,000時間を超える異種混在の身体化データで事前学習をスケールし、視覚言語理解と複数身体形態向け行動生成を共同最適化する一段階アライメントトレーニングを導入する。先行のGigaBrain-0シリーズおよびπ_{0.5}を含む従来の最先端モデルと比較して、GigaBrain-0.7は基盤ゼロショット性能、言語条件付き指示追従、事後学習タスク成功率において大幅な改善を達成する。特に、自社開発のMaker H01プラットフォームおよび主流のロボット身体形態において、GigaBrain-0.7は家庭および産業シナリオの両方で強いタスク適応性と完了能力を示す。すべてのトレーニングコードと事前学習済みモデル重みは公開予定である。
English
Vision-language-action (VLA) models have become a dominant paradigm for generalist embodied agents, demonstrating strong complex and long-horizon task completion in structured settings. Yet it remains an open question whether current VLA systems can benefit from more effective architectural design, scale to substantially larger and more heterogeneous data regimes, and achieve broader generalization across tasks and embodiments. To this end, we present GigaBrain-0.7, an embodied foundation model with substantially improved generalization across diverse robot embodiments. Specifically, GigaBrain-0.7 unifies understanding, prediction, and action through a three-system architecture, scales pretraining to over 37,000 hours of heterogeneous embodied data, and introduces one-stage alignment training that jointly optimizes vision-language understanding and multi-embodiment action generation. Compared with the preceding GigaBrain-0 series and prior state-of-the-art models including π_{0.5}, GigaBrain-0.7 achieves substantial improvements in foundation zero-shot capabilities, language-conditioned instruction following, and post-training task success rates. In particular, on our in-house Maker H01 platform and mainstream robot embodiments, GigaBrain-0.7 demonstrates strong task adaptability and completion ability across both home and industrial scenarios. All training code and pretrained model weights will be released.