ChatPaper.aiChatPaper

Intern-S2-Mobius:知识推理解耦的基础模型

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

August 14, 2026
作者: Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou
cs.AI

摘要

我们提出Mobius-v0架构,该架构由全局共享的Memory(FFN)和多个Reasoner(Self-Attn)组成,其中Memory用于存储知识向量,多个Reasoner迭代地实现组合推理。以隐藏状态作为缓存和载体,推理器反复查询记忆以获取所需的知识向量,同时知识被传递回推理操作器。通过这种知识-推理分离的架构,Mobius实现了更好的知识压缩和推理效率。基于Mobius-v0架构:1)我们从零训练的7B模型取得了与7B Transformer基线相当的下游得分,且仅使用了基线62.6%的训练数据。2)我们的Intern-S2-Mobius(从Qwen3.5-35B持续预训练而来)在取得相当下游得分的同时,实现了近4倍的端到端推理加速。
English
We introduce Mobius-v0, an architecture that comprises a globally shared Memory (FFN) that stores knowledge vectors and multiple Reasoners (Self-Attn) that iteratively achieve compositional reasoning. Using hidden states as cache and carrier, reasoners repeatedly query memory for required knowledge-vectors, while the knowledge is transmitted back to reasoning operators. Through this knowledge-reasoning-separation architecture, Mobius achieves better knowledge compression and reasoning efficiency. Built upon Mobius-v0 architecture: 1) Our 7B model trained-from-scratch achieves similar downstream score as a 7B Transformer baseline with 62.6% of baseline's training data. 2) Our Intern-S2-Mobius, continually-pretrained from Qwen3.5-35B, achieves similar downstream score while delivering nearly 4x end-to-end inference speedup.