ChatPaper.aiChatPaper

Intern-S2-Mobius: 지식과 추론이 분리된 기초 모델

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

August 14, 2026
저자: Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou
cs.AI

초록

우리는 전역적으로 공유되는 메모리(FFN)에 지식 벡터를 저장하고, 여러 추론기(Self-Attn)가 반복적으로 합성적 추론을 수행하는 구조인 Mobius-v0를 소개한다. 은닉 상태를 캐시 및 전달체로 활용하여, 추론기는 필요한 지식 벡터를 메모리에 반복적으로 질의하며, 지식은 다시 추론 연산자로 전송된다. 이러한 지식-추론 분리 구조를 통해 Mobius는 더 나은 지식 압축과 추론 효율성을 달성한다. Mobius-v0 구조를 기반으로: 1) 처음부터 학습된 우리의 7B 모델은 7B Transformer 기준 모델과 유사한 다운스트림 점수를 달성하면서도, 기준 모델 학습 데이터의 62.6%만을 사용한다. 2) Qwen3.5-35B에서 지속적 사전학습된 우리의 Intern-S2-Mobius는 유사한 다운스트림 점수를 달성하면서도, 약 4배의 종단 간 추론 속도 향상을 제공한다.
English
We introduce Mobius-v0, an architecture that comprises a globally shared Memory (FFN) that stores knowledge vectors and multiple Reasoners (Self-Attn) that iteratively achieve compositional reasoning. Using hidden states as cache and carrier, reasoners repeatedly query memory for required knowledge-vectors, while the knowledge is transmitted back to reasoning operators. Through this knowledge-reasoning-separation architecture, Mobius achieves better knowledge compression and reasoning efficiency. Built upon Mobius-v0 architecture: 1) Our 7B model trained-from-scratch achieves similar downstream score as a 7B Transformer baseline with 62.6% of baseline's training data. 2) Our Intern-S2-Mobius, continually-pretrained from Qwen3.5-35B, achieves similar downstream score while delivering nearly 4x end-to-end inference speedup.