ChatPaper.aiChatPaper

Intern-S2-Mobius:具備知識與推理解耦能力的基礎模型

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

August 14, 2026
作者: Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou
cs.AI

摘要

我們提出Mobius-v0,這是一種由全域共享的記憶體(FFN)所構成的架構,用於儲存知識向量,並搭配多個推理器(Self-Attn)以迭代方式達成組合性推理。以隱藏狀態作為快取與載體,推理器反覆查詢記憶體以取得所需知識向量,同時將知識傳回推理運算元。透過這種知識與推理分離的架構,Mobius实现了更佳的知識壓縮與推理效率。基於Mobius-v0架構:1)我們從零訓練的7B模型,其下游任務得分與7B Transformer基線模型相當,但僅需基線模型62.6%的訓練資料。2)我們的Intern-S2-Mobius,由Qwen3.5-35B持續預訓練而成,在達到相近下游任務得分的同時,端到端推論速度提升近4倍。
English
We introduce Mobius-v0, an architecture that comprises a globally shared Memory (FFN) that stores knowledge vectors and multiple Reasoners (Self-Attn) that iteratively achieve compositional reasoning. Using hidden states as cache and carrier, reasoners repeatedly query memory for required knowledge-vectors, while the knowledge is transmitted back to reasoning operators. Through this knowledge-reasoning-separation architecture, Mobius achieves better knowledge compression and reasoning efficiency. Built upon Mobius-v0 architecture: 1) Our 7B model trained-from-scratch achieves similar downstream score as a 7B Transformer baseline with 62.6% of baseline's training data. 2) Our Intern-S2-Mobius, continually-pretrained from Qwen3.5-35B, achieves similar downstream score while delivering nearly 4x end-to-end inference speedup.