ChatPaper.aiChatPaper

Intern-S2-Mobius:知識と推論を分離した基盤モデル

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

August 14, 2026
著者: Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou
cs.AI

要旨

我々は、知識ベクトルを格納するグローバルに共有されたメモリ(FFN)と、構成的推論を反復的に実行する複数の推論器(自己注意)から構成されるアーキテクチャであるMobius-v0を提案する。隠れ状態をキャッシュおよび伝達媒体として用いることで、推論器は必要な知識ベクトルをメモリに繰り返し問い合わせ、知識は推論演算子へと送り返される。この知識-推論分離アーキテクチャにより、Mobiusはより優れた知識圧縮と推論効率を達成する。Mobius-v0アーキテクチャに基づき、(1) ゼロから学習した7Bモデルは、7B Transformerベースラインと同等のダウンストリームスコアを、ベースラインの学習データの62.6%で達成する。(2) Qwen3.5-35Bから継続事前学習したIntern-S2-Mobiusは、同等のダウンストリームスコアを達成しながら、約4倍のエンドツーエンド推論高速化を実現する。
English
We introduce Mobius-v0, an architecture that comprises a globally shared Memory (FFN) that stores knowledge vectors and multiple Reasoners (Self-Attn) that iteratively achieve compositional reasoning. Using hidden states as cache and carrier, reasoners repeatedly query memory for required knowledge-vectors, while the knowledge is transmitted back to reasoning operators. Through this knowledge-reasoning-separation architecture, Mobius achieves better knowledge compression and reasoning efficiency. Built upon Mobius-v0 architecture: 1) Our 7B model trained-from-scratch achieves similar downstream score as a 7B Transformer baseline with 62.6% of baseline's training data. 2) Our Intern-S2-Mobius, continually-pretrained from Qwen3.5-35B, achieves similar downstream score while delivering nearly 4x end-to-end inference speedup.