GigaBrain-0.7:采用三系统架构将具身基础模型扩展至涌现能力
GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
August 16, 2026
作者: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu
cs.AI
摘要
视觉-语言-动作(VLA)模型已成为通用具身智能体的主流范式,在结构化环境中展现出强大的复杂任务和长时程任务完成能力。然而,当前VLA系统能否受益于更有效的架构设计、扩展到规模显著更大且更多样化的异构数据体系,并在跨任务和跨本体上实现更广泛的泛化,仍是一个悬而未决的问题。为此,我们提出GigaBrain-0.7,一个在多样化机器人本体上实现显著泛化能力提升的具身基础模型。具体而言,GigaBrain-0.7通过三系统架构统一理解、预测与动作,将预训练扩展到超过37,000小时的异构具身数据,并引入单阶段对齐训练,联合优化视觉-语言理解与多本体动作生成。与之前的GigaBrain-0系列以及包括π_{0.5}在内的先前最先进模型相比,GigaBrain-0.7在基础零样本能力、语言条件指令跟随以及后训练任务成功率方面均取得了显著提升。特别是,在我们自研的Maker H01平台和主流机器人本体上,GigaBrain-0.7在家庭和工业场景中均展现出强大的任务适应性和完成能力。所有训练代码和预训练模型权重将全面开源。
English
Vision-language-action (VLA) models have become a dominant paradigm for generalist embodied agents, demonstrating strong complex and long-horizon task completion in structured settings. Yet it remains an open question whether current VLA systems can benefit from more effective architectural design, scale to substantially larger and more heterogeneous data regimes, and achieve broader generalization across tasks and embodiments. To this end, we present GigaBrain-0.7, an embodied foundation model with substantially improved generalization across diverse robot embodiments. Specifically, GigaBrain-0.7 unifies understanding, prediction, and action through a three-system architecture, scales pretraining to over 37,000 hours of heterogeneous embodied data, and introduces one-stage alignment training that jointly optimizes vision-language understanding and multi-embodiment action generation. Compared with the preceding GigaBrain-0 series and prior state-of-the-art models including π_{0.5}, GigaBrain-0.7 achieves substantial improvements in foundation zero-shot capabilities, language-conditioned instruction following, and post-training task success rates. In particular, on our in-house Maker H01 platform and mainstream robot embodiments, GigaBrain-0.7 demonstrates strong task adaptability and completion ability across both home and industrial scenarios. All training code and pretrained model weights will be released.